Claude Opus 5.5 llega un 20% más barato y con una salvaguarda que recurre a modelos antiguos

El recorte en las lecturas de caché pesa más que el precio del titular, y una nota al pie revela cuándo tu solicitud deja de ser atendida por Opus 5.5

|5 min de lectura0
Server racks of the kind that serve frontier model inference, where cache-read pricing decides the cost of long-running Claude Opus 5.5 agent sessions.
Server racks of the kind that serve frontier model inference, where cache-read pricing decides the cost of long-running Claude Opus 5.5 agent sessions.

La cifra más relevante del lanzamiento de Claude Opus 5.5 no es la que encabezó la mayoría de las coberturas. Es cierto que los tokens de entrada y salida bajaron un 20%, hasta 4 y 20 dólares por millón. Pero las lecturas de caché cayeron un 60%, hasta 0,20 dólares por millón, y en las sesiones prolongadas de agentes para las que está construido este modelo, ese es el renglón que decide la factura.

Claves del anuncio

  • Claude Opus 5.5 cuesta 4 dólares por millón de tokens de entrada y 20 por millón de salida, con lecturas de caché a 0,20 dólares por millón, un 60% por debajo de Opus 5.
  • Anthropic despliega el modelo con salvaguardas de producción que pueden derivar tareas de ciberseguridad a Claude Opus 4.8 y tareas de biología o de desarrollo de modelos de frontera a Claude Opus 5.
  • Opus 5.5 registra 66,4% en Terminal-Bench 4.0 y 1846 Elo en GDPval-AA v2.1, por delante tanto de Claude Fable 5.1 como de GPT-6 Astra de OpenAI.

Por qué el precio del caché define la economía de los agentes

Un agente que trabaja sobre un repositorio durante toda la noche no envía contexto nuevo en cada turno: reenvía una y otra vez el mismo prompt de sistema, las mismas definiciones de herramientas y los mismos archivos. Esos prefijos repetidos son lecturas de caché, y dominan el contador en cualquier sesión que se mida en horas y no en segundos.

La propia Anthropic lo reconoce al describir las lecturas de caché como la mayor parte de lo que cuesta el trabajo agéntico y de programación. Por eso un recorte del 60% ahí hace más por una migración nocturna que cualquier rebaja del 20% en la entrada nueva. Los equipos que presupuestaron Opus 5 solo por tokens de salida estuvieron modelando la variable equivocada.

El rendimiento se movió en la misma dirección. La generación de salida es más de un 30% más rápida que en Opus 5. Un modo Fast aparte, dentro de Claude Code y la Claude Platform, cambia precio por latencia a 8 y 40 dólares por millón de tokens y promete hasta 2,5 veces más velocidad. Los límites de uso de cinco horas subieron en los planes Pro, Max, Team y Enterprise por asiento, y ahora los suscriptores pueden acumular un reinicio de límite de tasa y gastarlo cuando aprieta una fecha de entrega.

Cuándo tu solicitud deja de ser Opus 5.5

Conviene leer dos veces una nota al pie. Como Opus 5.5 queda cerca de Claude Mythos 5.1 en capacidad de biología y ciberseguridad, Anthropic lo distribuye detrás de las salvaguardas que construyó para Fable 5.1. Cuando esas salvaguardas se activan, la solicitud no falla: la termina otro modelo.

Las tareas de ciberseguridad fueron completadas por Claude Opus 4.8, y las de biología y desarrollo de LLM de frontera, por Claude Opus 5.

Está divulgado y no escondido, y es un diseño de seguridad defendible. También es un cambio silencioso de capacidad dentro de un producto por el que se pagan tarifas de frontera. Quien construya herramientas de seguridad sobre la API debería asumir que una fracción de su tráfico la responde un modelo de dos versiones atrás. La pregunta práctica no es si el respaldo está justificado, sino si el entorno de evaluación puede avisar cuándo se activó, porque la respuesta llega con el mismo aspecto que cualquier otra.

El mecanismo también distorsiona las tablas de puntuación. Zapier ejecutó las pruebas de AutomationBench sin un respaldo configurado, así que cada intervención de la salvaguarda contó como fallo, y de ahí que Opus 5.5 terminara en 40,0% frente al 41,4% de GPT-6 Astra. Anthropic sostiene que un despliegue en producción no perdería esos puntos. El gráfico rival de OpenAI muestra la misma maquinaria desde el otro lado: una configuración de Fable 5.1 con respaldo en Opus 5 alcanzó 31,4%, y OpenAI admitió que esa cifra de costo excluía los respaldos que se activaron en cerca del 40% de las tareas.

Qué midieron realmente los evaluadores

Casi toda la evidencia publicada por Anthropic habla de volumen, no de ingenio. Un evaluador cerró una migración de 680.000 líneas de código en un día. Otro auditó y reparó un repositorio de 200.000 líneas en menos de tres horas; Opus 5 necesitó más de 20 horas y 2,5 veces los tokens. Un port interno de HAProxy de C a Rust terminó en 9,5 horas frente a 12 de Fable 5.1, con un costo un 51% menor.

Nada de eso afirma más inteligencia. Son afirmaciones de rendimiento, y el rendimiento es lo que convierte una actualización de modelo en una línea del presupuesto. Las cifras de clientes repiten el patrón: menos pasos, menos salida, resultado igual o mejor. Deloitte comprobó que el modelo, en su nivel de esfuerzo más bajo, detectó el 72% de los errores conocidos en revisión de código, mientras que Opus 5 con esfuerzo alto llegó al 56%. Hebbia le dio un 86,6% de cobertura en flujos financieros calificados por expertos, frente al 60,3% de Opus 5. En pruebas públicas, Opus 5.5 anota 66,4% en Terminal-Bench 4.0 y 1846 Elo en GDPval-AA v2.1, donde Fable 5.1 queda en 1735 y GPT-6 Astra en 1542.

Un ritmo que su propio CEO llamó demasiado rápido

El calendario es la parte incómoda. The Register contó 21 días entre Fable 5.1 y Opus 5.5, y 39 entre Opus 5 y Fable 5.1, con el llamado público del CEO Dario Amodei a moderar los avances de capacidad apenas diez días antes de este lanzamiento. Anthropic publicó la misma mañana en que OpenAI presentó GPT-6 Sol y Luna, tres semanas después de que GPT-6 Astra llegara a clientes empresariales. Los detalles completos están en la publicación de lanzamiento de Anthropic. Sonnet 5.5 y Haiku 5.5 llegarán en las próximas semanas, y será entonces cuando el descuento en lecturas de caché importe al mayor número de cargas de trabajo.

FAQ — Preguntas frecuentes

¿Cuánto cuesta Claude Opus 5.5?

Opus 5.5 cuesta 4 dólares por millón de tokens de entrada y 20 por millón de salida, un 20% menos que Opus 5. Las lecturas de caché están en 0,20 dólares por millón, una reducción del 60%. Un modo Fast aparte en Claude Code y la Claude Platform cuesta 8 y 40 dólares por millón de tokens y ofrece hasta 2,5 veces más velocidad.

¿Puede Anthropic derivar mi solicitud de Opus 5.5 a un modelo anterior?

Sí, en casos acotados. Anthropic indica que cuando intervienen las salvaguardas de producción de Opus 5.5, las tareas de ciberseguridad las completa Claude Opus 4.8 y las de biología o desarrollo de modelos de frontera, Claude Opus 5. Las organizaciones verificadas pueden postular al Life Sciences Verification Program de Anthropic, y el Cyber Verification Program se ampliará en las próximas semanas.

¿Es Opus 5.5 mejor que GPT-6 Astra?

Depende de la tarea. Opus 5.5 lidera en Terminal-Bench 4.0 (66,4% frente a 57,9%) y GDPval-AA v2.1 (1846 Elo frente a 1542), mientras que Astra lidera en AutomationBench (41,4% frente a 40,0%) y Terminal-Bench-Science 0.1 (64,6% frente a 58,7%). Los laboratorios corrieron estas evaluaciones con entornos y niveles de esfuerzo distintos, así que los márgenes no son directamente comparables.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas
Developer Tools

OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas

OpenAI lanzó el martes dos modelos intermedios y construyó su argumento casi por completo sobre el precio. GPT-6 Sol cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida.

Seung Junghace 8 horas
GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Junghace 13 días
El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito
LLM & Chatbots

El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito

Meta lanzó Muse, un agente de IA personal que reserva viajes, paga facturas y compra por ti en iOS, Android, la web y WhatsApp en Estados Unidos.

Seung Junghace 12 días
Anthropic advierte de que un malware infostealer está vaciando cuentas de pago de Claude
LLM & Chatbots

Anthropic advierte de que un malware infostealer está vaciando cuentas de pago de Claude

Anthropic escribe a los usuarios de Claude cuyas sesiones robó un malware infostealer, que permite a terceros gastar su uso de pago sin ver una contraseña.

Seung Junghace 13 días
Claude es solo para adultos y su detector de edad sigue bloqueando a adultos
LLM & Chatbots

Claude es solo para adultos y su detector de edad sigue bloqueando a adultos

Anthropic detalló cómo aplica la regla de +18 en Claude: clasificadores automáticos desactivan cuentas sospechosas de pertenecer a menores y Yoti gestiona la apelación.

Seung Junghace 12 días
OpenAI lanza el mismo día un agente de Datos y un ChatGPT para Wall Street
LLM & Chatbots

OpenAI lanza el mismo día un agente de Datos y un ChatGPT para Wall Street

OpenAI presentó el mismo jueves un agente de Datos para ChatGPT Work y ChatGPT for Financial Services, desarrollado con Morgan Stanley y Evercore.

Seung Junghace 13 días