Opus 5.5 al máximo esfuerzo tardó 682 segundos en soltar su primer token

Artificial Analysis sitúa esta configuración del buque insignia de Anthropic en 58 puntos de su Intelligence Index frente a una mediana de 26, alcanzados con 260 millones de tokens de salida y 5,98 dólares por tarea.

|4 min de lectura0
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.

Ya hay cifras de terceros sobre el buque insignia más reciente de Anthropic, y describen un modelo que encabeza la tabla y que cobra un precio inusual por llegar ahí. Artificial Analysis puntúa a Claude Opus 5.5 —en su configuración de razonamiento adaptativo, máximo esfuerzo y repliegue por defecto— con 58 sobre el Intelligence Index v4.3.2, muy por encima de la mediana de 26 de los modelos de razonamiento de una franja de precio similar. La misma página registra un tiempo hasta el primer token de 682,71 segundos. La mediana es de 3,79.

Puntos clave

  • Opus 5.5 con máximo esfuerzo obtiene 58 puntos en el Artificial Analysis Intelligence Index v4.3.2, frente a una mediana de 26 entre modelos de razonamiento comparables.
  • Completar el índice consumió 260 millones de tokens de salida, unas tres veces la mediana de 88 millones, con un coste medio de 5,98 dólares por tarea.
  • Artificial Analysis anota 682,71 segundos hasta el primer token en esa configuración, frente a una mediana de 3,79 segundos, aunque la salida fluye después a 95,5 tokens por segundo.

Qué mide realmente el índice

El Intelligence Index v4.3.2 es una puntuación compuesta por diez evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. Mezcla tareas laborales agénticas, uso de terminal, programación científica y recuperación en contexto largo, de modo que una sola cifra se mueve tanto por el comportamiento con herramientas como por el conocimiento en bruto.

Artificial Analysis compara los modelos propietarios con otros de su misma franja de precio combinada, no con el sector entero, así que ese 26 es una referencia entre pares y no una media de la industria. Opus 5.5 admite texto e imagen, devuelve texto y cuenta con una ventana de contexto de un millón de tokens.

El coste está en los tokens, no en la tarifa

Las tarifas publicadas por Anthropic son de 4,00 dólares por millón de tokens de entrada y 20,00 por millón de salida, frente a medianas de 2,00 y 10,00 en la misma franja: el doble sobre el papel. Esa brecha se ensancha en cuanto se contabiliza la verbosidad. Terminar el índice exigió 260 millones de tokens de salida donde el modelo mediano necesitó 88 millones, y la media por tarea quedó en 5,98 dólares.

Esa es la cifra que conviene llevarse al presupuesto. Anthropic fijó el precio de Opus 5.5 en torno a un 20% por debajo de su antecesor, pero un descuento por token no sobrevive a un modelo que piensa el triple. Los equipos que miden el gasto por petición y no por token serán los primeros en notarlo.

Cómo leer los 682 segundos

La cifra de latencia necesita sus matices bien dichos. Corresponde a la configuración de razonamiento adaptativo al máximo esfuerzo, que concentra la deliberación antes de producir salida, y Artificial Analysis mide el tiempo hasta el primer token de respuesta como una métrica distinta del tiempo hasta el primer token. Es la medición de un ajuste concreto, no de cada petición que llega a la API.

Dicho esto, 682,71 segundos son más de once minutos de silencio, y conviven con unos 95,5 tokens por segundo —por encima de la media— una vez arranca la generación. La forma de ese perfil importa para el diseño de producto: Opus 5.5 a pleno esfuerzo es una herramienta de lotes, no interactiva. Cualquier flujo que espere respuesta dentro del tiempo de espera de una petición necesita bajar el nivel de esfuerzo, y el propio nombre de la configuración —repliegue por defecto— recuerda que Anthropic incluye un salvavidas capaz de derivar el trabajo a un modelo anterior.

Las mediciones llegan además en una semana en la que los desarrolladores detectaron cuatro patrones de petición que ahora devuelven error 400 en Opus 5.5, y en la que la propia tarjeta de sistema de Anthropic reveló intentos de fuga del entorno aislado en el 1,5% de las pruebas adversarias. El cuadro que dibujan las tres cosas es coherente: la configuración más capaz es también la que más aristas operativas obliga a prever.

FAQ — Preguntas frecuentes

¿Cada petición a Opus 5.5 tarda once minutos?

No. La cifra corresponde a la configuración de razonamiento adaptativo al máximo esfuerzo, que gasta su presupuesto razonando antes de responder. Con niveles de esfuerzo más bajos el comportamiento cambia, y Artificial Analysis informa por separado del tiempo hasta el primer token de respuesta.

¿Por qué importa el número de tokens si bajó el precio por token?

Porque la facturación sigue a los tokens, no a las peticiones. Opus 5.5 generó 260 millones de tokens de salida en el Intelligence Index frente a una mediana de 88 millones, así que una tarifa más baja puede acabar en una factura más alta: en este caso, 5,98 dólares de media por tarea.

¿Qué es el Artificial Analysis Intelligence Index?

Es una puntuación compuesta a partir de diez evaluaciones públicas y privadas, hoy en su versión 4.3.2, que cubre tareas agénticas, programación, contexto largo y conocimiento. Los modelos se comparan dentro de su clase, de modo que los de razonamiento se clasifican junto a pares con y sin razonamiento de la misma franja de precio.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Junghace 18 días
Anthropic advierte de que un malware infostealer está vaciando cuentas de pago de Claude
LLM & Chatbots

Anthropic advierte de que un malware infostealer está vaciando cuentas de pago de Claude

Anthropic escribe a los usuarios de Claude cuyas sesiones robó un malware infostealer, que permite a terceros gastar su uso de pago sin ver una contraseña.

Seung Junghace 18 días
Claude es solo para adultos y su detector de edad sigue bloqueando a adultos
LLM & Chatbots

Claude es solo para adultos y su detector de edad sigue bloqueando a adultos

Anthropic detalló cómo aplica la regla de +18 en Claude: clasificadores automáticos desactivan cuentas sospechosas de pertenecer a menores y Yoti gestiona la apelación.

Seung Junghace 17 días
Claude Opus 5.5 llega un 20% más barato y con una salvaguarda que recurre a modelos antiguos
LLM & Chatbots

Claude Opus 5.5 llega un 20% más barato y con una salvaguarda que recurre a modelos antiguos

Claude Opus 5.5 cuesta 4/20 dólares por millón de tokens con las lecturas de caché un 60% más baratas, e incorpora salvaguardas que pueden derivar parte del trabajo a modelos Claude anteriores.

Seung Junghace 5 días
Grok 4.7 mantiene su precio y duplica su nota en terminal: la factura sigue siendo el argumento
LLM & Chatbots

Grok 4.7 mantiene su precio y duplica su nota en terminal: la factura sigue siendo el argumento

Los lanzamientos de modelos frontera suelen llegar con una subida de precio. Grok 4.7, disponible desde el 21 de septiembre, no la trae: la entrada sigue en 2 dólares por millón de tokens y la salida en 6.

Seung Junghace 7 días
El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito
LLM & Chatbots

El agente Muse de Meta quiere tu correo, tu calendario y tu tarjeta de crédito

Meta lanzó Muse, un agente de IA personal que reserva viajes, paga facturas y compra por ti en iOS, Android, la web y WhatsApp en Estados Unidos.

Seung Junghace 17 días