Claude Opus 5.5: análisis a fondo del modelo que abarata la frontera

Anthropic lanzó ayer, 22 de septiembre, Claude Opus 5.5. Menos de dos meses después de Opus 5, y con una jugada que me parece más interesante que cualquier cifra de benchmark suelta: rendimiento al nivel de su modelo más caro (Fable 5.1) costando un 60% menos en API. He pasado el día revisando el anuncio, los datos y los primeros análisis independientes, y este es mi desglose honesto: qué hay de verdad en los números, dónde están los matices que el marketing no cuenta, y qué supone para una empresa española que esté aplicando IA en serio.
TL;DR
Claude Opus 5.5 no es noticia por ganar benchmarks: es noticia por ganar la mayoría de ellos costando 4$/20$ por millón de tokens frente a los 10$/50$ de Fable 5.1 y los 5$/25$ de Opus 5. Supera a su hermano mayor en Terminal-Bench (66,4% vs 55,8%), FrontierCode (54,4% vs 50,3%) y trabajo profesional (GDPval Elo 1846 vs 1735), genera un 30% más rápido, consume entre un 20 y un 40% menos de tokens por tarea y baja las lecturas de caché un 60%. La lectura estratégica: la guerra de modelos ya no va de quién saca la nota más alta, va de quién completa más trabajo por euro. Y esa es exactamente la métrica que las empresas deberían estar midiendo.
Cuatro ideas si no vas a leer el análisis completo. Una: la capacidad frontera se está abaratando a un ritmo que hace seis meses parecía imposible — lo que costaba 60$ por millón de tokens combinados en julio cuesta 24$ hoy con mejor rendimiento. Dos: los benchmarks del fabricante son direccionales, no evangelio; los matices (harness, safeguards activos, resultados seleccionados) importan. Tres: para el que usa la API hay cambios que rompen código — thinking siempre activo, esfuerzo por defecto en medium, tool_choice forzado eliminado. Cuatro: la métrica que decide todo esto no es el precio por token, es el coste por tarea completada, y quien no la esté midiendo está eligiendo proveedor a ciegas.
¿Qué ha lanzado Anthropic exactamente?
Claude Opus 5.5 es el sucesor de Opus 5 dentro de la gama media-alta de Anthropic. Mismo contexto de 1 millón de tokens, misma salida máxima de 128K (300K vía la API de lotes), mismo tokenizador. Lo que cambia es el interior: un modelo entrenado para hacer más con menos, con tres cifras de cabecera que el propio anuncio repite. Genera la salida un 30% más rápido que Opus 5. Resuelve tareas agénticas de programación con en torno a un 40% menos de llamadas. Y consume entre un 20 y un 25% menos de tokens de salida para trabajo equivalente. La suma de las tres es el titular real: un 40% menos de coste en cargas de trabajo típicas, antes de contar la bajada nominal de precio.
El contexto competitivo importa para leer esto bien. Anthropic tiene desde este verano una gama de tres alturas: Fable 5.1 como tope de gama (10$/50$), la línea Opus como caballo de batalla y Sonnet/Haiku para volumen. Con Opus 5.5, la altura intermedia alcanza — y en la mayoría de benchmarks publicados supera — a la superior de hace tres meses. Es el patrón que llevamos viendo dos años en este mercado: la capacidad de frontera baja un escalón de precio cada pocos meses. Pero la velocidad se está acelerando, y eso tiene consecuencias directas sobre qué proyectos de IA salen rentables, como veremos más abajo.
El lanzamiento llega además con nombres detrás que dan señal de uso real, no de demo: GitHub, Spotify, Lovable, Quantium, Optiver o Kiro aparecen como early testers, con citas concretas. La del CPO de GitHub es la más reveladora del posicionamiento: “los desarrolladores quieren agentes que asuman trabajo de software real y lo terminen; Opus 5.5 usó de los menores números de tokens y pasos que hemos medido”. Terminar el trabajo, con pocos pasos. Ese es el producto que se vende aquí, no un chatbot más listo.
¿Qué dicen los benchmarks, y cómo hay que leerlos?
Vamos a los números, que para eso estamos. Esta es la tabla consolidada de los benchmarks publicados en el anuncio oficial y desglosados por Vellum, con los cuatro modelos relevantes de la comparativa — los dos Claude anteriores y los dos de OpenAI:
| Benchmark | Qué mide | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | Agentes autónomos en terminal | 66,4% | 55,8% | 52,3% | 57,9% |
| FrontierCode v1.1 | Pull requests de código en producción | 54,4% | 50,3% | 48,0% | 53,3% |
| CursorBench 4.0 | Sesiones reales de programación | 57,8% | 51,8% | 46,6% | — |
| GDPval-AA v2.1 (Elo) | Trabajo profesional de conocimiento | 1846 | 1735 | 1708 | 1542 |
| Humanity’s Last Exam | Razonamiento multidisciplinar | 67,7% | 65,6% | 63,6% | 57,2% |
| OSWorld 2.0 | Automatización de sistema operativo | 81,8% | 80,7% | 74,0% | — |
| Chartography | Comprensión visual de gráficos | 89,0% | 88,4% | 83,4% | — |
| AutomationBench | Workflows SaaS multipaso | 40,0% | 31,4% | 26,9% | 41,4% |
| Terminal-Bench-Science 0.1 | Investigación científica | 58,7% | 52,6% | 29,0% | 64,6% |
La foto general es clara: Opus 5.5 lidera siete de las nueve evaluaciones publicadas, incluyendo todas las de programación agéntica y trabajo profesional. Y la medición independiente apunta en la misma dirección: Artificial Analysis lo situó en el primer puesto de su Intelligence Index con 58 puntos, liderando seis de sus diez evaluaciones core, según recogió VentureBeat.
Ahora, los matices que casi nadie va a contarte y que a mí me parecen la parte más interesante del análisis:
Uno: dónde pierde, y por qué. Los dos benchmarks donde GPT-6 Astra gana tienen truco, pero un truco que juega en contra de Anthropic por decisión propia. En AutomationBench, la evaluación se hizo sin modelos de respaldo activados: cada vez que los safeguards de seguridad intervinieron en una tarea, esa tarea contó como fallo. En Terminal-Bench-Science, las tareas marcadas como sensibles de biología se evaluaron con las barreras activas, restando puntos. Es decir: Opus 5.5 pierde en parte porque su capa de seguridad frena tareas que otros modelos ejecutan sin preguntar. Puedes leerlo como debilidad competitiva o como honestidad de producto; probablemente es ambas.
Dos: el dato de esfuerzo medio es el más importante de la tabla y está en la letra pequeña. En FrontierCode, Opus 5.5 a esfuerzo medio saca 54,6% — más que a esfuerzo máximo (54,4%) y más de lo que Opus 5 saca a esfuerzo alto. Anthropic afirma que en varios benchmarks su configuración más baja de esfuerzo supera a Opus 5 en la más alta. Si eso se sostiene en producción, la implicación económica es enorme: no solo pagas menos por token, sino que necesitas menos “profundidad de razonamiento” (y por tanto menos tokens) para el mismo resultado.
Tres: siguen siendo benchmarks del fabricante. Resultados seleccionados, harness propio y casos de cliente elegidos por el equipo de marketing. El propio análisis de VentureBeat lo advierte: no existe todavía una comparativa pública con el mismo harness frente a GPT-6, así que cualquier afirmación fina de coste-rendimiento entre ambos es prematura. Mi regla con cada lanzamiento — la apliqué con Claude Fable 5 y la aplico hoy — es tratar los benchmarks como hipótesis direccionales y validarlas con tus propias tareas antes de mover nada a producción.
Criterio atómico: un benchmark del fabricante te dice dónde mirar; solo tu propia carga de trabajo te dice qué comprar.
¿La verdadera noticia es el precio?
Sí. Y me explico con la tabla delante, porque las cifras por sí solas ya cuentan la historia:
| Modelo | Entrada ($/M tokens) | Salida ($/M tokens) | Caché lectura ($/M) |
|---|---|---|---|
| Claude Fable 5.1 | 10,00 | 50,00 | 0,25 |
| Claude Opus 5 | 5,00 | 25,00 | 0,50 |
| Claude Opus 5.5 | 4,00 | 20,00 | 0,20 |
| GPT-6 Sol | 2,00 | 10,00 | 0,20 |
Tres lecturas. La primera y evidente: rendimiento de gama Fable a precio un 60% inferior. Para cualquier organización que estuviera pagando el tope de gama para sus flujos críticos, la cuenta es inmediata. La segunda, menos evidente y más importante: la bajada del 60% en lecturas de caché (de 0,50$ a 0,20$). Los sistemas de IA aplicada serios — asistentes sobre bases de conocimiento propias, agentes con contexto persistente, workflows que reutilizan el mismo prompt de sistema miles de veces — leen de caché constantemente. Ese es el coste que domina la factura en producción, y acaba de dividirse por 2,5.
La tercera lectura es la competitiva. GPT-6 Sol de OpenAI sigue siendo la mitad de barato en tokens sin cachear (2$/10$). Pero en caché están empatados a 0,20$, y aquí vuelve el concepto que llevo meses repitiendo a clientes: el precio por token es la métrica equivocada. Lo que importa es el coste por tarea completada — cuántos intentos, cuántos pasos, cuánta supervisión y cuánto retrabajo necesita cada modelo para dejar el trabajo hecho. El dato de Quantium en el lanzamiento ilustra la diferencia mejor que cualquier teoría: una tarea compleja de programación que antes llevaba 38 prompts repartidos en cuatro días se cerró con 11 prompts en tres horas. El coste por token de esos 11 prompts es casi anecdótico frente al coste de las 30 horas de ingeniero que desaparecen de la ecuación.
Anthropic aporta sus propios ejemplos de esta aritmética, que tomo con la cautela debida por ser del fabricante pero que van todos en la misma línea: una traducción de HAProxy de C a Rust en 9,5 horas frente a las 12 de Fable 5.1 con un 51% menos de coste; una auditoría de un codebase de 200.000 líneas en menos de 3 horas frente a más de 20 con Opus 5; un modelo financiero en 63 minutos frente a 93, a mitad de coste. Y el que más me llama la atención para trabajo no técnico: en su evaluación interna de informes de conocimiento, 16 de 18 pasaron la verificación de calidad — frente a cero de Fable 5.1 y Opus 5. Si ese salto en fiabilidad de trabajo de oficina se confirma fuera del laboratorio, el impacto en automatización de back-office es mayor que todo lo demás junto.
¿Qué supone para una empresa que está aplicando IA?
Aquí es donde me pongo el sombrero de Datalvar AI, porque esta es la conversación que voy a tener con clientes las próximas semanas. Tres consecuencias prácticas.
Primera: proyectos que no salían rentables ahora salen. Cuando haces el caso de inversión de un workflow con IA — triaje de correos, generación de propuestas, extracción de datos de documentos — el coste de inferencia es una de las líneas que decide si el payback llega en 6 meses o en 18. Un 40% menos de coste real por tarea, con mejor tasa de finalización, mueve proyectos enteros del cajón de “no compensa” al de “arrancamos”. Especialmente en pyme, donde los márgenes de esa cuenta son estrechos. Si el año pasado te hicieron un caso de inversión de IA y salió justo, toca rehacerlo con precios de 2026: probablemente ya no sale justo.
Segunda: la selección de modelo se vuelve una decisión de compra seria, y el “routing” es la estrategia ganadora. El patrón que consolida este lanzamiento es el que ya veníamos aplicando: modelo frontera para el trabajo complejo, modelo medio para lo repetido, modelo barato para subtareas acotadas. Con Opus 5.5, la casilla del medio da un salto de calidad que obliga a re-evaluar todo el reparto. Y la evaluación no se hace leyendo benchmarks: se hace pasando tus propias tareas por el modelo nuevo y midiendo finalización, tokens, pasos e intervención humana. Quien tenga esa disciplina de medición montada, migra con datos en una semana. Quien no la tenga… tiene un problema anterior al modelo, que es no saber si tiene IA aplicada o solo tiene chat.
Tercera: los agentes de larga duración dejan de ser experimento caro. El anuncio habla de ejecuciones autónomas de más de 18 horas, delegación en subagentes y autoverificación. Sé el escepticismo que merecen estas afirmaciones en un press release — llevo dos años viéndolas inflarse —, pero la dirección es innegable y el precio la hace por fin explorable con presupuestos de empresa media. La barrera para pilotar un agente que trabaje una noche entera sobre un proceso concreto ya no es económica; es organizativa: gobernanza, supervisión y saber elegir el caso. Que es exactamente donde siempre estuvo el trabajo de verdad.
Para el usuario de a pie de las apps, por cierto, la recomendación es más simple: Opus 5.5 ya está en Claude.ai y en las apps móviles, y salvo casos muy específicos de razonamiento extremo, hoy es el mejor modelo por defecto de Anthropic para trabajo diario. En mi stack personal, donde Claude es el cerebro desde hace tiempo, el cambio se nota sobre todo en una cosa que el anuncio menciona de pasada y que a mí me importa mucho: escribe más claro, con menos relleno y con la información importante al principio. Un 40% menos de verborrea en algunas configuraciones. Después de dos años peleándome con la tendencia de los modelos a envolver todo en algodón, eso solo ya justifica la versión.
¿Y la seguridad? La parte que casi nadie lee y que va a importar
Termino el análisis técnico por donde casi todos los resúmenes pasan de puntillas. Anthropic afirma que Opus 5.5 logra los mejores resultados hasta la fecha en su auditoría automatizada de comportamiento, que intenta saltarse los límites de contención un 85% menos que Opus 5, y que resiste mejor la inyección de prompts. Fue evaluado antes del lanzamiento por METR y Frontier Design, dos organizaciones externas. Además, el razonamiento ya no se puede desactivar, las tareas sensibles de ciberseguridad se redirigen a otro modelo y hay marcado de agua conforme al AI Act europeo.
¿Por qué le dedico un párrafo a esto en un blog de marketing y negocio? Porque la resistencia a inyección de prompts y la negativa a ejecutar acciones difíciles de revertir no son features de laboratorio: son el requisito previo para conectar un agente a tu CRM, tu email o tu pasarela de pagos sin jugártela. La adopción empresarial de agentes está frenada más por confianza que por capacidad, y cada punto de mejora en contención vale más que cinco puntos de benchmark. El trade-off es visible en la propia tabla de arriba — Opus 5.5 pierde dos benchmarks en parte porque sus safeguards frenan tareas que la competencia ejecuta —, y es un trade-off que, hablando como alguien que despliega estos sistemas en empresas reales, compro sin dudarlo.
Para los que tocáis la API, recordatorio rápido de los cambios que rompen código al migrar desde Opus 5: thinking siempre activo (sin opción de desactivarlo), esfuerzo por defecto en medium — no en high, este es el cambio silencioso que os va a despistar en las comparativas —, tool_choice forzado eliminado, y bloques de razonamiento ligados al modelo y la conversación. Nada grave, todo migrable en una tarde, pero probadlo antes de cambiar el string en producción.
Mi lectura final: la frontera se abarata más rápido de lo que las empresas la absorben
Si me quedo con una sola idea del lanzamiento, es esta: en julio, el mejor rendimiento disponible en la gama Opus costaba 30$ por millón de tokens combinados y rendía un 52% en Terminal-Bench. Hoy cuesta 24$, rinde un 66% y gasta la mitad de tokens en llegar. En tres meses. Mientras tanto, la mayoría de las empresas españolas que conozco siguen en el mismo punto de madurez de IA que en primavera: licencias compradas, pilotos a medias, métricas sin definir.
Esa brecha — entre lo que la tecnología ya permite a precio asumible y lo que las organizaciones son capaces de absorber — es el dato estratégico real de 2026, y se está ensanchando con cada lanzamiento. La buena noticia es que la ventana sigue abierta y ahora cuesta menos cruzarla que nunca. La menos buena: tus competidores leen los mismos anuncios que tú. Como escribí cuando salió Fable 5, el modelo nunca fue la ventaja; la ventaja es la organización que sabe convertir modelo en proceso, proceso en métrica y métrica en margen. Opus 5.5 acaba de bajar el precio de la entrada. Entrar sigue siendo trabajo vuestro.
Fuentes: anuncio oficial de Anthropic, desglose de benchmarks de Vellum, análisis de VentureBeat y cobertura de TechCrunch.
Preguntas frecuentes