Claude Sonnet 5.5 supera a su propio flagship en coding por la mitad de precio, pero quema más tokens de lo anunciado
Terminal-Bench 4.0: 70,6 % para Sonnet 5.5 frente a 66,4 % de Opus 5.5. El test independiente confirma la victoria y desmonta parte del ahorro: a esfuerzo máximo consume un 60 % más de tokens que Opus.
Anthropic lanza Sonnet 5.5, el segundo modelo de la familia 5.5: mismo precio que Sonnet 5 (2 $/M entrada, 10 $/M salida), 30 % más rápido y por primera vez un Sonnet que supera a Opus en la benchmark estrella de agentes de terminal. Artificial Analysis valida el ranking pero mide 193.000 tokens por tarea a esfuerzo máximo: el ahorro real solo llega a ajustes medios.
Qué ha ocurrido
Anthropic ha publicado Claude Sonnet 5.5, segundo modelo de la familia Claude 5.5 que inauguró Opus 5.5 la semana pasada. Mantiene el precio de Sonnet 5 —2 $ por millón de tokens de entrada y 10 $ por millón de salida, la mitad que Opus 5.5— y promete ser 30 % más rápido y hasta un 30 % más barato por tarea gracias a un menor consumo de tokens. En Terminal-Bench 4.0, la benchmark de referencia para agentes que ejecutan tareas profesionales desde la terminal, Anthropic le atribuye un 70,6 % de tareas completadas frente al 66,4 % de Opus 5.5: es el primer Sonnet que supera al flagship de su casa en la prueba fuerte. Haiku 5.5, el modelo barato de la familia, llegará «en las próximas semanas».
Por qué importa
Es el tercer lanzamiento de Anthropic desde que Dario Amodei pidiera públicamente frenar el ritmo de desarrollo, y el segundo en menos de una semana: la cadencia de lanzamientos de la casa «más cautelista» ya es semanal. Para quien construye sobre APIs, el mensaje es que la frontera de coding se ha movido al segmento medio de precio: near-flagship a 10 $/M salidas cambia la economía de agentes de alto volumen. La segunda lección, más incómoda, es de métrica: el ahorro de coste por tarea que anuncian los laboratorios depende del ajuste de esfuerzo que elijas, y los tests independientes empiezan a auditar esa contabilidad.
Qué sabemos
- Anthropic lo anuncia como complemento de Opus 5.5 para tareas bien delimitadas, corrección de bugs y documentos; primer Sonnet que termina Pokémon Red solo a partir de capturas de pantalla (señal de capacidad de largo horizonte y visión).
- Artificial Analysis, test independiente, confirma la victoria sobre Opus 5.5 en su versión de Terminal-Bench: 63,6 % frente a 59,6 % (GPT-6 Astra de OpenAI, 59,1 %). Lo coloca segundo en su overall solo tras Opus 5.5.
- El matiz: a esfuerzo máximo, Sonnet 5.5 ha escrito ~193.000 tokens por tarea —el mayor que Artificial Analysis ha medido, ~60 % más que Opus 5.5— y ~7,60 $ por tarea, un 50 % más caro que Sonnet 5. El «hasta 30 % más barato» de Anthropic se apoya en el esfuerzo Medium (el ajuste por defecto), donde afirma batir el mejor registro de coding de Sonnet 5 por una décima parte del coste. Artificial Analysis sitúa el mejor valor en esfuerzo High.
- No avanza la frontera de capacidad según la propia Anthropic: es un modelo de destilación/eficiencia sobre la familia 5.5, presentado como «no frontier» a efectos de su framework de seguridad (RSP).
Qué no sabemos
- La metodología exacta con la que Anthropic calcula el «hasta 30 % más barato por tarea»: no publica los ratios de tokens por tarea que usa.
- Cuándo llega Haiku 5.5 y con qué desplaza la escalera de precios.
- Disponibilidad y cuotas en las plataformas de terceros (Azure Foundry ya ha listado Opus 5.5; se espera Sonnet 5.5, sin fecha confirmada).
Qué vigilar
La respuesta de OpenAI y Google en el segmento medio —GPT-6 Astra está a 0,2 puntos de Sonnet 5.5 en el ranking independiente— y si la guerra de benchmarks de Terminal-Bench se convierte en el campo donde los modelos medios adelantan a los flagship semana sí, semana también.
Qué cambió
Qué sabemos · qué no
Confirmado
- Publicado el 28-sep-2026 al mismo precio que Sonnet 5: 2 $/M entrada, 10 $/M salida, 0,20 $/M cache reads.
- Terminal-Bench 4.0: 70,6 % propio y 63,6 % de Artificial Analysis, por delante de Opus 5.5 (66,4 % / 59,6 %) y GPT-6 Astra (59,1 %).
- 30 %+ más rápido que Sonnet 5; Haiku 5.5 anunciado para las próximas semanas.
Todavía no
- La metodología del «30 % más barato por tarea» que anuncia Anthropic.
- Ficha técnica de Haiku 5.5 y disponibilidad en plataformas de terceros.
- Cómo se comporta el esfuerzo Medium (el por defecto) en cargas de agentes reales y no en benchmarks.
Para ir al grano técnico
Qué vigilamos ahora
Haiku 5.5, la réplica de OpenAI/Google en el segmento medio y las mediciones independientes de coste real por tarea a esfuerzo Medium.
Fuentes
Naturaleza de la afirmación principal: Anuncio de la empresa. Fuente primaria consultada y verificable.
- Anthropic — Introducing Claude Sonnet 5.5 · nivel 1 · primaria · consultada 29 sept
- TechCrunch · nivel 2 · medio · consultada 29 sept
- CNBC · nivel 2 · medio · consultada 29 sept
- Decrypt (medición Artificial Analysis) · nivel 2 · medio · consultada 29 sept
Se relaciona con
- Un tribunal de EE. UU. avala que el Pentágono excluya a Anthropic por decir «no» a Claude · 29 sept
- Florida pide a un juez paralizar el desarrollo de modelos de OpenAI sin supervisión externa · 29 sept
- OpenAI pausa el entrenamiento de sus modelos más capaces tras escapar un agente de su sandbox por DNS · 26 sept