El Sonnet 5.5 de Anthropic supera al Opus 5.5 en codificación con agentes

El modelo de gama media mantiene el precio de Sonnet 5, de 2 dólares por millón de tokens de entrada, mientras Anthropic promete un 30% más de velocidad y hasta un 30% menos de costo por tarea

|5 min de lectura0
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.

Anthropic lanzó Claude Sonnet 5.5 el lunes, y la cifra que importa no es el precio: es una prueba de rendimiento donde el modelo barato le gana al caro. En el informe de resultados publicado por Anthropic, Sonnet 5.5 obtiene 70.6% en Terminal-Bench 4.0, una evaluación de codificación con agentes, contra 66.4% de Claude Opus 5.5. Sonnet 5, lanzado hace tres meses, apenas alcanzó 10.3% en la misma prueba.

Key takeaways

  • Sonnet 5.5 obtiene 70.6% en Terminal-Bench 4.0 frente al 66.4% del más costoso Opus 5.5.
  • El precio no cambia respecto a Sonnet 5: 2 dólares por millón de tokens de entrada y 10 por millón de salida. El ahorro viene de consumir menos tokens, no de una tarifa más baja.
  • Balyasny Asset Management reportó respuestas de 121.000 tokens donde Sonnet 5 gastaba 497.000.

De dónde sale realmente el recorte del 30%

Anthropic promete una generación más de 30% más rápida y hasta 30% menos de costo por tarea. La segunda cifra se malinterpreta con facilidad. El precio de lista no se movió: la entrada sigue en 2 dólares por millón de tokens y la salida en 10, con lecturas de caché a 0.20 dólares y escrituras a 2.50. El ahorro aparece porque el modelo termina los trabajos con menos tokens y menos llamadas a herramientas, un tipo distinto de mejora: solo se refleja en la factura si la carga de trabajo funciona con agentes.

Las cifras de clientes que publicó Anthropic lo hacen concreto. Slack informó que igualó o superó a Sonnet 5 en casi todas sus evaluaciones, con menos pasos y alrededor de 14% menos tokens de salida. Box midió resultados 2.4 veces más rápidos con 12% menos tokens en total. Lovable señaló que las tareas terminaron con un tercio menos de llamadas a herramientas y cerca de la mitad de ejecuciones de shell. El dato más contundente vino de Balyasny Asset Management: 121.000 tokens por respuesta, donde Sonnet 5 había quemado 497.000.

Cómo leer la tabla de resultados

Sonnet 5.5 queda cerca de Opus 5.5 en casi todo y por delante en un solo punto. En OSWorld 2.1 obtiene 80.1% contra 81.8% de Opus 5.5, y sube desde el 57.0% de Sonnet 5. Humanity's Last Exam da 64.5% frente a 67.7%. En GDPval-AA v2.1 los dos quedan empatados en la práctica, con 1844 y 1846, y en AA-Briefcase v1.1 la brecha es de 1811 a 1822. Terminal-Bench también es la única de las tres pruebas que Anthropic clasifica como codificación con agentes en la que gana Sonnet 5.5: Opus 5.5 lidera en CursorBench 4.0, 57.8% a 55.5%, y en FrontierCode 1.1, 54.4% a 46.2%. Anthropic aclara que Sonnet 5.5 puntúa más bajo en el ajuste Max que en Xhigh dentro de FrontierCode, porque en Max ejecutaba con más frecuencia una habilidad de revisión de código que producía ediciones fuera de alcance y tiempos de espera agotados, algo que la prueba penaliza.

La columna de Sonnet 5 es la que exige cautela. Un salto de 10.3% a 70.6% en Terminal-Bench 4.0, o de 15.6% a 61.6% en Chartography, dice más sobre lo mal que la generación anterior manejaba esos entornos de prueba concretos que sobre una mejora de siete veces en capacidad. La comparación válida es Sonnet 5.5 contra Opus 5.5, y ahí la conclusión es que un modelo de gama media ya se ubica a un par de puntos del modelo insignia en la mayoría del trabajo, mientras permite ejecutar más agentes en paralelo con el mismo presupuesto.

Lo que Anthropic dejó bajo un mecanismo de reemplazo

Sonnet 5.5 llega con una restricción que sus antecesores no tenían. Anthropic indica que las tareas de ciberseguridad de mayor riesgo se derivarán de forma visible a Sonnet 5, una degradación explícita en lugar de un rechazo. TechCrunch informó que así Sonnet se convierte en el primer modelo de su gama sujeto a las salvaguardas cibernéticas antes reservadas a Opus y Fable, sobre la base de que su capacidad en ese terreno ya es comparable a la de Opus 5. Es también el primer Sonnet que se despacha con clasificadores destinados a impedir que los rivales extraigan sus trazas de razonamiento para destilarlas. Las salvaguardas en biología se mantienen sin cambios desde Sonnet 5.

Contexto: la pelea está en la gama media

Ya nadie compite en el precio de los modelos insignia. OpenAI redujo a la mitad los precios de sus tokens de gama media con Sol y Luna la semana pasada, y Meta anunció un modelo para impulsar una función de lentes inteligentes. La respuesta de Anthropic no es una tarifa más baja, sino un modelo que consume menos de ella, respaldado por ahorros de hasta 90% con caché de prompts y de 50% con procesamiento por lotes.

Perspectiva

Sonnet 5.5 está disponible en Claude.ai y, para desarrolladores, en la Claude Platform además de Amazon Web Services, Google Cloud y Microsoft Azure, con el identificador claude-sonnet-5-5. Se espera un Haiku renovado en las próximas semanas, sin fecha comprometida. La pregunta abierta es para qué sirve todavía Opus 5.5: si el modelo barato se queda con la prueba de codificación en terminal y empata en trabajo de conocimiento, al insignia le queda como argumento el criterio frente a problemas difíciles de medir.

FAQ

¿Claude Sonnet 5.5 es más caro que Sonnet 5?

No. Cuesta lo mismo: 2 dólares por millón de tokens de entrada y 10 por millón de salida, con lecturas de caché a 0.20 dólares y escrituras a 2.50. La promesa de hasta 30% menos costo por tarea proviene de que el modelo usa menos tokens y menos llamadas a herramientas, no de una tarifa reducida.

¿Sonnet 5.5 le gana de verdad a Opus 5.5?

En Terminal-Bench 4.0, una evaluación de codificación con agentes, sí: 70.6% contra 66.4%, y Anthropic reporta esa cifra de Opus 5.5 en su ajuste de máximo esfuerzo. Es la única de las tres pruebas de codificación con agentes publicadas por Anthropic en la que Sonnet 5.5 queda por delante; Opus 5.5 lidera en CursorBench 4.0 y FrontierCode 1.1. Opus 5.5 también conserva una ventaja de uno a tres puntos en OSWorld 2.1 y Humanity's Last Exam.

¿Dónde pueden usar los desarrolladores Sonnet 5.5?

Está disponible de forma nativa en la Claude Platform y a través de Amazon Web Services, Google Cloud y Microsoft Azure, con el identificador claude-sonnet-5-5. El acceso para usuarios finales es por Claude.ai.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Opus 5.5 al máximo esfuerzo tardó 682 segundos en soltar su primer token
LLM & Chatbots

Opus 5.5 al máximo esfuerzo tardó 682 segundos en soltar su primer token

Artificial Analysis midió 682,71 segundos hasta el primer token en la configuración de máximo esfuerzo de Claude Opus 5.5, frente a una mediana de 3,79 segundos.

Seung Junghace 19 horas
Anthropic advierte de que un malware infostealer está vaciando cuentas de pago de Claude
LLM & Chatbots

Anthropic advierte de que un malware infostealer está vaciando cuentas de pago de Claude

Anthropic escribe a los usuarios de Claude cuyas sesiones robó un malware infostealer, que permite a terceros gastar su uso de pago sin ver una contraseña.

Seung Junghace 19 días
Mercury 2.5 llega a 1.107 tokens por segundo y cuatro centavos el millón
LLM & Chatbots

Mercury 2.5 llega a 1.107 tokens por segundo y cuatro centavos el millón

Una startup de agentes telefónicos afirma que Mercury recortó su peor tiempo de respuesta de minutos a un segundo. El nuevo modelo de difusión de Inception Labs está construido alrededor de esa clase de cifra.

Seung Junghace 15 días
Claude es solo para adultos y su detector de edad sigue bloqueando a adultos
LLM & Chatbots

Claude es solo para adultos y su detector de edad sigue bloqueando a adultos

Anthropic detalló cómo aplica la regla de +18 en Claude: clasificadores automáticos desactivan cuentas sospechosas de pertenecer a menores y Yoti gestiona la apelación.

Seung Junghace 17 días
Claude Opus 5.5 llega un 20% más barato y con una salvaguarda que recurre a modelos antiguos
LLM & Chatbots

Claude Opus 5.5 llega un 20% más barato y con una salvaguarda que recurre a modelos antiguos

Claude Opus 5.5 cuesta 4/20 dólares por millón de tokens con las lecturas de caché un 60% más baratas, e incorpora salvaguardas que pueden derivar parte del trabajo a modelos Claude anteriores.

Seung Junghace 6 días
El mejor modelo en el nuevo test de salud mental de OpenAI saca 57,3%
LLM & Chatbots

El mejor modelo en el nuevo test de salud mental de OpenAI saca 57,3%

MentalHealthBench, creado por OpenAI con más de 80 clínicos de 22 países, tiene su techo en el 57,3% de GPT-6 Astra. Claude Opus 5.5 obtuvo 52,4%.

Seung Junghace 23 horas