Saltar al contenido

Claude Opus 5.5: análisis a fondo del modelo que abarata la frontera

José Alvargonzález 12 min de lectura

Análisis de Claude Opus 5.5: benchmarks, precios y qué supone para las empresas

Anthropic lanzó ayer, 22 de septiembre, Claude Opus 5.5. Menos de dos meses después de Opus 5, y con una jugada que me parece más interesante que cualquier cifra de benchmark suelta: rendimiento al nivel de su modelo más caro (Fable 5.1) costando un 60% menos en API. He pasado el día revisando el anuncio, los datos y los primeros análisis independientes, y este es mi desglose honesto: qué hay de verdad en los números, dónde están los matices que el marketing no cuenta, y qué supone para una empresa española que esté aplicando IA en serio.

TL;DR

Claude Opus 5.5 no es noticia por ganar benchmarks: es noticia por ganar la mayoría de ellos costando 4$/20$ por millón de tokens frente a los 10$/50$ de Fable 5.1 y los 5$/25$ de Opus 5. Supera a su hermano mayor en Terminal-Bench (66,4% vs 55,8%), FrontierCode (54,4% vs 50,3%) y trabajo profesional (GDPval Elo 1846 vs 1735), genera un 30% más rápido, consume entre un 20 y un 40% menos de tokens por tarea y baja las lecturas de caché un 60%. La lectura estratégica: la guerra de modelos ya no va de quién saca la nota más alta, va de quién completa más trabajo por euro. Y esa es exactamente la métrica que las empresas deberían estar midiendo.

Cuatro ideas si no vas a leer el análisis completo. Una: la capacidad frontera se está abaratando a un ritmo que hace seis meses parecía imposible — lo que costaba 60$ por millón de tokens combinados en julio cuesta 24$ hoy con mejor rendimiento. Dos: los benchmarks del fabricante son direccionales, no evangelio; los matices (harness, safeguards activos, resultados seleccionados) importan. Tres: para el que usa la API hay cambios que rompen código — thinking siempre activo, esfuerzo por defecto en medium, tool_choice forzado eliminado. Cuatro: la métrica que decide todo esto no es el precio por token, es el coste por tarea completada, y quien no la esté midiendo está eligiendo proveedor a ciegas.

¿Qué ha lanzado Anthropic exactamente?

Claude Opus 5.5 es el sucesor de Opus 5 dentro de la gama media-alta de Anthropic. Mismo contexto de 1 millón de tokens, misma salida máxima de 128K (300K vía la API de lotes), mismo tokenizador. Lo que cambia es el interior: un modelo entrenado para hacer más con menos, con tres cifras de cabecera que el propio anuncio repite. Genera la salida un 30% más rápido que Opus 5. Resuelve tareas agénticas de programación con en torno a un 40% menos de llamadas. Y consume entre un 20 y un 25% menos de tokens de salida para trabajo equivalente. La suma de las tres es el titular real: un 40% menos de coste en cargas de trabajo típicas, antes de contar la bajada nominal de precio.

El contexto competitivo importa para leer esto bien. Anthropic tiene desde este verano una gama de tres alturas: Fable 5.1 como tope de gama (10$/50$), la línea Opus como caballo de batalla y Sonnet/Haiku para volumen. Con Opus 5.5, la altura intermedia alcanza — y en la mayoría de benchmarks publicados supera — a la superior de hace tres meses. Es el patrón que llevamos viendo dos años en este mercado: la capacidad de frontera baja un escalón de precio cada pocos meses. Pero la velocidad se está acelerando, y eso tiene consecuencias directas sobre qué proyectos de IA salen rentables, como veremos más abajo.

El lanzamiento llega además con nombres detrás que dan señal de uso real, no de demo: GitHub, Spotify, Lovable, Quantium, Optiver o Kiro aparecen como early testers, con citas concretas. La del CPO de GitHub es la más reveladora del posicionamiento: “los desarrolladores quieren agentes que asuman trabajo de software real y lo terminen; Opus 5.5 usó de los menores números de tokens y pasos que hemos medido”. Terminar el trabajo, con pocos pasos. Ese es el producto que se vende aquí, no un chatbot más listo.

¿Qué dicen los benchmarks, y cómo hay que leerlos?

Vamos a los números, que para eso estamos. Esta es la tabla consolidada de los benchmarks publicados en el anuncio oficial y desglosados por Vellum, con los cuatro modelos relevantes de la comparativa — los dos Claude anteriores y los dos de OpenAI:

BenchmarkQué mideOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.0Agentes autónomos en terminal66,4%55,8%52,3%57,9%
FrontierCode v1.1Pull requests de código en producción54,4%50,3%48,0%53,3%
CursorBench 4.0Sesiones reales de programación57,8%51,8%46,6%—
GDPval-AA v2.1 (Elo)Trabajo profesional de conocimiento1846173517081542
Humanity’s Last ExamRazonamiento multidisciplinar67,7%65,6%63,6%57,2%
OSWorld 2.0Automatización de sistema operativo81,8%80,7%74,0%—
ChartographyComprensión visual de gráficos89,0%88,4%83,4%—
AutomationBenchWorkflows SaaS multipaso40,0%31,4%26,9%41,4%
Terminal-Bench-Science 0.1Investigación científica58,7%52,6%29,0%64,6%

La foto general es clara: Opus 5.5 lidera siete de las nueve evaluaciones publicadas, incluyendo todas las de programación agéntica y trabajo profesional. Y la medición independiente apunta en la misma dirección: Artificial Analysis lo situó en el primer puesto de su Intelligence Index con 58 puntos, liderando seis de sus diez evaluaciones core, según recogió VentureBeat.

Ahora, los matices que casi nadie va a contarte y que a mí me parecen la parte más interesante del análisis:

Uno: dónde pierde, y por qué. Los dos benchmarks donde GPT-6 Astra gana tienen truco, pero un truco que juega en contra de Anthropic por decisión propia. En AutomationBench, la evaluación se hizo sin modelos de respaldo activados: cada vez que los safeguards de seguridad intervinieron en una tarea, esa tarea contó como fallo. En Terminal-Bench-Science, las tareas marcadas como sensibles de biología se evaluaron con las barreras activas, restando puntos. Es decir: Opus 5.5 pierde en parte porque su capa de seguridad frena tareas que otros modelos ejecutan sin preguntar. Puedes leerlo como debilidad competitiva o como honestidad de producto; probablemente es ambas.

Dos: el dato de esfuerzo medio es el más importante de la tabla y está en la letra pequeña. En FrontierCode, Opus 5.5 a esfuerzo medio saca 54,6% — más que a esfuerzo máximo (54,4%) y más de lo que Opus 5 saca a esfuerzo alto. Anthropic afirma que en varios benchmarks su configuración más baja de esfuerzo supera a Opus 5 en la más alta. Si eso se sostiene en producción, la implicación económica es enorme: no solo pagas menos por token, sino que necesitas menos “profundidad de razonamiento” (y por tanto menos tokens) para el mismo resultado.

Tres: siguen siendo benchmarks del fabricante. Resultados seleccionados, harness propio y casos de cliente elegidos por el equipo de marketing. El propio análisis de VentureBeat lo advierte: no existe todavía una comparativa pública con el mismo harness frente a GPT-6, así que cualquier afirmación fina de coste-rendimiento entre ambos es prematura. Mi regla con cada lanzamiento — la apliqué con Claude Fable 5 y la aplico hoy — es tratar los benchmarks como hipótesis direccionales y validarlas con tus propias tareas antes de mover nada a producción.

Criterio atómico: un benchmark del fabricante te dice dónde mirar; solo tu propia carga de trabajo te dice qué comprar.

¿La verdadera noticia es el precio?

Sí. Y me explico con la tabla delante, porque las cifras por sí solas ya cuentan la historia:

ModeloEntrada ($/M tokens)Salida ($/M tokens)Caché lectura ($/M)
Claude Fable 5.110,0050,000,25
Claude Opus 55,0025,000,50
Claude Opus 5.54,0020,000,20
GPT-6 Sol2,0010,000,20

Tres lecturas. La primera y evidente: rendimiento de gama Fable a precio un 60% inferior. Para cualquier organización que estuviera pagando el tope de gama para sus flujos críticos, la cuenta es inmediata. La segunda, menos evidente y más importante: la bajada del 60% en lecturas de caché (de 0,50$ a 0,20$). Los sistemas de IA aplicada serios — asistentes sobre bases de conocimiento propias, agentes con contexto persistente, workflows que reutilizan el mismo prompt de sistema miles de veces — leen de caché constantemente. Ese es el coste que domina la factura en producción, y acaba de dividirse por 2,5.

La tercera lectura es la competitiva. GPT-6 Sol de OpenAI sigue siendo la mitad de barato en tokens sin cachear (2$/10$). Pero en caché están empatados a 0,20$, y aquí vuelve el concepto que llevo meses repitiendo a clientes: el precio por token es la métrica equivocada. Lo que importa es el coste por tarea completada — cuántos intentos, cuántos pasos, cuánta supervisión y cuánto retrabajo necesita cada modelo para dejar el trabajo hecho. El dato de Quantium en el lanzamiento ilustra la diferencia mejor que cualquier teoría: una tarea compleja de programación que antes llevaba 38 prompts repartidos en cuatro días se cerró con 11 prompts en tres horas. El coste por token de esos 11 prompts es casi anecdótico frente al coste de las 30 horas de ingeniero que desaparecen de la ecuación.

Anthropic aporta sus propios ejemplos de esta aritmética, que tomo con la cautela debida por ser del fabricante pero que van todos en la misma línea: una traducción de HAProxy de C a Rust en 9,5 horas frente a las 12 de Fable 5.1 con un 51% menos de coste; una auditoría de un codebase de 200.000 líneas en menos de 3 horas frente a más de 20 con Opus 5; un modelo financiero en 63 minutos frente a 93, a mitad de coste. Y el que más me llama la atención para trabajo no técnico: en su evaluación interna de informes de conocimiento, 16 de 18 pasaron la verificación de calidad — frente a cero de Fable 5.1 y Opus 5. Si ese salto en fiabilidad de trabajo de oficina se confirma fuera del laboratorio, el impacto en automatización de back-office es mayor que todo lo demás junto.

¿Qué supone para una empresa que está aplicando IA?

Aquí es donde me pongo el sombrero de Datalvar AI, porque esta es la conversación que voy a tener con clientes las próximas semanas. Tres consecuencias prácticas.

Primera: proyectos que no salían rentables ahora salen. Cuando haces el caso de inversión de un workflow con IA — triaje de correos, generación de propuestas, extracción de datos de documentos — el coste de inferencia es una de las líneas que decide si el payback llega en 6 meses o en 18. Un 40% menos de coste real por tarea, con mejor tasa de finalización, mueve proyectos enteros del cajón de “no compensa” al de “arrancamos”. Especialmente en pyme, donde los márgenes de esa cuenta son estrechos. Si el año pasado te hicieron un caso de inversión de IA y salió justo, toca rehacerlo con precios de 2026: probablemente ya no sale justo.

Segunda: la selección de modelo se vuelve una decisión de compra seria, y el “routing” es la estrategia ganadora. El patrón que consolida este lanzamiento es el que ya veníamos aplicando: modelo frontera para el trabajo complejo, modelo medio para lo repetido, modelo barato para subtareas acotadas. Con Opus 5.5, la casilla del medio da un salto de calidad que obliga a re-evaluar todo el reparto. Y la evaluación no se hace leyendo benchmarks: se hace pasando tus propias tareas por el modelo nuevo y midiendo finalización, tokens, pasos e intervención humana. Quien tenga esa disciplina de medición montada, migra con datos en una semana. Quien no la tenga… tiene un problema anterior al modelo, que es no saber si tiene IA aplicada o solo tiene chat.

Tercera: los agentes de larga duración dejan de ser experimento caro. El anuncio habla de ejecuciones autónomas de más de 18 horas, delegación en subagentes y autoverificación. Sé el escepticismo que merecen estas afirmaciones en un press release — llevo dos años viéndolas inflarse —, pero la dirección es innegable y el precio la hace por fin explorable con presupuestos de empresa media. La barrera para pilotar un agente que trabaje una noche entera sobre un proceso concreto ya no es económica; es organizativa: gobernanza, supervisión y saber elegir el caso. Que es exactamente donde siempre estuvo el trabajo de verdad.

Para el usuario de a pie de las apps, por cierto, la recomendación es más simple: Opus 5.5 ya está en Claude.ai y en las apps móviles, y salvo casos muy específicos de razonamiento extremo, hoy es el mejor modelo por defecto de Anthropic para trabajo diario. En mi stack personal, donde Claude es el cerebro desde hace tiempo, el cambio se nota sobre todo en una cosa que el anuncio menciona de pasada y que a mí me importa mucho: escribe más claro, con menos relleno y con la información importante al principio. Un 40% menos de verborrea en algunas configuraciones. Después de dos años peleándome con la tendencia de los modelos a envolver todo en algodón, eso solo ya justifica la versión.

¿Y la seguridad? La parte que casi nadie lee y que va a importar

Termino el análisis técnico por donde casi todos los resúmenes pasan de puntillas. Anthropic afirma que Opus 5.5 logra los mejores resultados hasta la fecha en su auditoría automatizada de comportamiento, que intenta saltarse los límites de contención un 85% menos que Opus 5, y que resiste mejor la inyección de prompts. Fue evaluado antes del lanzamiento por METR y Frontier Design, dos organizaciones externas. Además, el razonamiento ya no se puede desactivar, las tareas sensibles de ciberseguridad se redirigen a otro modelo y hay marcado de agua conforme al AI Act europeo.

¿Por qué le dedico un párrafo a esto en un blog de marketing y negocio? Porque la resistencia a inyección de prompts y la negativa a ejecutar acciones difíciles de revertir no son features de laboratorio: son el requisito previo para conectar un agente a tu CRM, tu email o tu pasarela de pagos sin jugártela. La adopción empresarial de agentes está frenada más por confianza que por capacidad, y cada punto de mejora en contención vale más que cinco puntos de benchmark. El trade-off es visible en la propia tabla de arriba — Opus 5.5 pierde dos benchmarks en parte porque sus safeguards frenan tareas que la competencia ejecuta —, y es un trade-off que, hablando como alguien que despliega estos sistemas en empresas reales, compro sin dudarlo.

Para los que tocáis la API, recordatorio rápido de los cambios que rompen código al migrar desde Opus 5: thinking siempre activo (sin opción de desactivarlo), esfuerzo por defecto en medium — no en high, este es el cambio silencioso que os va a despistar en las comparativas —, tool_choice forzado eliminado, y bloques de razonamiento ligados al modelo y la conversación. Nada grave, todo migrable en una tarde, pero probadlo antes de cambiar el string en producción.

Mi lectura final: la frontera se abarata más rápido de lo que las empresas la absorben

Si me quedo con una sola idea del lanzamiento, es esta: en julio, el mejor rendimiento disponible en la gama Opus costaba 30$ por millón de tokens combinados y rendía un 52% en Terminal-Bench. Hoy cuesta 24$, rinde un 66% y gasta la mitad de tokens en llegar. En tres meses. Mientras tanto, la mayoría de las empresas españolas que conozco siguen en el mismo punto de madurez de IA que en primavera: licencias compradas, pilotos a medias, métricas sin definir.

Esa brecha — entre lo que la tecnología ya permite a precio asumible y lo que las organizaciones son capaces de absorber — es el dato estratégico real de 2026, y se está ensanchando con cada lanzamiento. La buena noticia es que la ventana sigue abierta y ahora cuesta menos cruzarla que nunca. La menos buena: tus competidores leen los mismos anuncios que tú. Como escribí cuando salió Fable 5, el modelo nunca fue la ventaja; la ventaja es la organización que sabe convertir modelo en proceso, proceso en métrica y métrica en margen. Opus 5.5 acaba de bajar el precio de la entrada. Entrar sigue siendo trabajo vuestro.

Fuentes: anuncio oficial de Anthropic, desglose de benchmarks de Vellum, análisis de VentureBeat y cobertura de TechCrunch.

Etiquetas: Claude Opus 5.5 Anthropic benchmarks IA modelos de IA 2026 IA aplicada coste por tarea
Volver al blog

Preguntas frecuentes

FAQ

¿Qué es Claude Opus 5.5 y en qué se diferencia de Opus 5?
Claude Opus 5.5 es el modelo que Anthropic lanzó el 22 de septiembre de 2026 como sucesor de Opus 5 dentro de la gama Opus, menos de dos meses después de su predecesor. Las diferencias prácticas son tres: rinde por encima de Opus 5 en prácticamente todos los benchmarks publicados (66,4% frente a 52,3% en Terminal-Bench 4.0, por ejemplo), cuesta un 20% menos por token (4$/20$ por millón frente a 5$/25$) y es notablemente más eficiente: genera la salida un 30% más rápido y resuelve tareas agénticas con en torno a un 40% menos de llamadas. La combinación de mejor rendimiento y menos tokens consumidos es lo que lleva a Anthropic a hablar de un 40% menos de coste en cargas de trabajo típicas, más allá de la bajada nominal de precio. Para quien ya usa Opus 5 vía API hay cambios de compatibilidad que conviene revisar antes de migrar: el razonamiento (thinking) ya no se puede desactivar, el tool_choice forzado devuelve error y el nivel de esfuerzo por defecto baja de high a medium.
¿Claude Opus 5.5 es mejor que Claude Fable 5.1?
Depende del benchmark, y esa es precisamente la noticia. En la mayoría de las evaluaciones publicadas por Anthropic, Opus 5.5 supera a Fable 5.1: Terminal-Bench 4.0 (66,4% frente a 55,8%), FrontierCode v1.1 (54,4% frente a 50,3%), GDPval de trabajo profesional (Elo 1846 frente a 1735) o Humanity's Last Exam (67,7% frente a 65,6%). Todo ello costando un 60% menos en precio de API (4$/20$ frente a 10$/50$ por millón de tokens). El matiz honesto: son benchmarks seleccionados y medidos por el propio fabricante, y Fable 5.1 sigue siendo el modelo que Anthropic posiciona como tope de gama para el razonamiento más exigente y las tareas de horizonte muy largo. Pero que el modelo "de segunda fila" de un fabricante supere a su buque insignia de hace tres meses en la mayoría de las pruebas, a una fracción del precio, dice mucho sobre la velocidad a la que se está abaratando la capacidad frontera. Para la inmensa mayoría de casos de uso empresariales, Opus 5.5 pasa a ser el punto de partida razonable.
¿Cuánto cuesta Claude Opus 5.5?
En la API de Anthropic: 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida, con lecturas de caché a 0,20 dólares por millón (una bajada del 60% respecto a Opus 5) y escrituras de caché a 5 dólares. Existe además un "fast mode" a precio doble (8$/40$) que genera la salida notablemente más rápido. Para usuarios de la app, está disponible en Claude.ai y en las aplicaciones móviles dentro de los planes de suscripción habituales. El precio nominal, con todo, es la mitad de la historia. Anthropic afirma que el modelo usa entre un 20 y un 25% menos de tokens de salida que Opus 5 para el mismo trabajo y resuelve tareas agénticas con un 40% menos de llamadas, lo que sitúa el ahorro real en cargas típicas en torno al 40%. Mi consejo para cualquier empresa: deja de comparar precios por millón de tokens y empieza a medir coste por tarea completada. Es la única métrica que refleja lo que de verdad pagas.
¿Qué significa "coste por tarea completada" y por qué importa más que el precio por token?
El precio por token mide lo que cuesta cada palabra que el modelo lee o escribe; el coste por tarea completada mide lo que cuesta que el trabajo quede terminado y correcto. Son cosas muy distintas porque un modelo barato por token que necesita más intentos, más pasos, más supervisión humana o más retrabajo acaba siendo más caro que uno nominalmente más costoso que lo resuelve a la primera. Un ejemplo del propio lanzamiento: una tarea de programación compleja que antes requería 38 prompts a lo largo de cuatro días se resolvió con 11 prompts en tres horas. Para una empresa que está aplicando IA en serio, esto cambia cómo se evalúan los proveedores. Las preguntas correctas dejan de ser "¿cuánto cuesta el millón de tokens?" y pasan a ser: ¿qué porcentaje de tareas completa sin intervención?, ¿cuántos tokens y pasos consume de media por tarea?, ¿cuánto retrabajo genera? Esa disciplina de medición es exactamente la misma que separa tener IA aplicada de tener una licencia de chat: si no mides el proceso, no puedes saber qué modelo te sale más barato.
¿Qué cambios rompe Claude Opus 5.5 para los que ya usan la API?
Hay cuatro cambios que pueden romper código escrito para Opus 5. Uno: el razonamiento (thinking) ya no se puede desactivar; la única palanca de control es el nivel de esfuerzo, y su valor por defecto baja de high a medium, así que conviene fijarlo explícitamente si tu carga necesita más profundidad. Dos: el tool_choice forzado (obligar al modelo a usar una herramienta concreta) devuelve error; se sustituye por instrucciones en el prompt más validación estricta de esquemas o salidas estructuradas. Tres: los bloques de razonamiento quedan ligados al modelo y a la conversación (el mecanismo de "preserved thinking" contra la destilación). Y cuatro: el uso de ordenador solo funciona con el toolset nuevo. Ninguno es dramático, pero todos requieren tocar código y volver a probar. Mi recomendación es la de siempre con cualquier migración de modelo: no cambies el string del modelo en producción y cruces los dedos. Prueba primero en un entorno controlado, revisa el nivel de esfuerzo por defecto (es el cambio más traicionero porque no da error, simplemente rinde distinto) y mide antes y después con tus propias tareas, no con los benchmarks del fabricante.
¿Merece la pena para una pyme española o esto es solo para grandes empresas?
La bajada de precios de la capacidad frontera beneficia proporcionalmente más a la pyme que a la gran empresa, porque el presupuesto es la barrera de entrada clásica. Tareas que hace un año exigían pagar el modelo más caro del mercado (análisis documental complejo, generación de informes con verificación, automatizaciones agénticas de varios pasos) ahora cuestan una fracción. Y con lecturas de caché a 0,20$ por millón, los casos de uso con mucho contexto repetido (bases de conocimiento internas, asistentes sobre documentación propia) se abaratan un 60% adicional. Dicho esto, el criterio no cambia: el modelo no es la estrategia. Una pyme sin un caso de uso concreto, con métrica y con propietario, no va a sacar más valor de Opus 5.5 del que sacaba de Opus 5, de GPT o de cualquier otro. La secuencia sigue siendo elegir un cuello de botella real, medirlo, atacarlo con el modelo que dé mejor coste por tarea completada, y escalar solo lo que funciona. Lo que sí ha cambiado es que la excusa del precio para no empezar es cada vez más difícil de sostener.

Cookies

Configurar cookies

Elige qué tipos de cookies aceptas. Puedes cambiar tu elección en cualquier momento desde el enlace "Configurar cookies" del pie de página.

Necesarias

Imprescindibles para el funcionamiento básico del sitio. No se pueden desactivar.

Siempre activas