Ya hay cifras de terceros sobre el buque insignia más reciente de Anthropic, y describen un modelo que encabeza la tabla y que cobra un precio inusual por llegar ahí. Artificial Analysis puntúa a Claude Opus 5.5 —en su configuración de razonamiento adaptativo, máximo esfuerzo y repliegue por defecto— con 58 sobre el Intelligence Index v4.3.2, muy por encima de la mediana de 26 de los modelos de razonamiento de una franja de precio similar. La misma página registra un tiempo hasta el primer token de 682,71 segundos. La mediana es de 3,79.
Puntos clave
- Opus 5.5 con máximo esfuerzo obtiene 58 puntos en el Artificial Analysis Intelligence Index v4.3.2, frente a una mediana de 26 entre modelos de razonamiento comparables.
- Completar el índice consumió 260 millones de tokens de salida, unas tres veces la mediana de 88 millones, con un coste medio de 5,98 dólares por tarea.
- Artificial Analysis anota 682,71 segundos hasta el primer token en esa configuración, frente a una mediana de 3,79 segundos, aunque la salida fluye después a 95,5 tokens por segundo.
Qué mide realmente el índice
El Intelligence Index v4.3.2 es una puntuación compuesta por diez evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. Mezcla tareas laborales agénticas, uso de terminal, programación científica y recuperación en contexto largo, de modo que una sola cifra se mueve tanto por el comportamiento con herramientas como por el conocimiento en bruto.
Artificial Analysis compara los modelos propietarios con otros de su misma franja de precio combinada, no con el sector entero, así que ese 26 es una referencia entre pares y no una media de la industria. Opus 5.5 admite texto e imagen, devuelve texto y cuenta con una ventana de contexto de un millón de tokens.
El coste está en los tokens, no en la tarifa
Las tarifas publicadas por Anthropic son de 4,00 dólares por millón de tokens de entrada y 20,00 por millón de salida, frente a medianas de 2,00 y 10,00 en la misma franja: el doble sobre el papel. Esa brecha se ensancha en cuanto se contabiliza la verbosidad. Terminar el índice exigió 260 millones de tokens de salida donde el modelo mediano necesitó 88 millones, y la media por tarea quedó en 5,98 dólares.
Esa es la cifra que conviene llevarse al presupuesto. Anthropic fijó el precio de Opus 5.5 en torno a un 20% por debajo de su antecesor, pero un descuento por token no sobrevive a un modelo que piensa el triple. Los equipos que miden el gasto por petición y no por token serán los primeros en notarlo.
Cómo leer los 682 segundos
La cifra de latencia necesita sus matices bien dichos. Corresponde a la configuración de razonamiento adaptativo al máximo esfuerzo, que concentra la deliberación antes de producir salida, y Artificial Analysis mide el tiempo hasta el primer token de respuesta como una métrica distinta del tiempo hasta el primer token. Es la medición de un ajuste concreto, no de cada petición que llega a la API.
Dicho esto, 682,71 segundos son más de once minutos de silencio, y conviven con unos 95,5 tokens por segundo —por encima de la media— una vez arranca la generación. La forma de ese perfil importa para el diseño de producto: Opus 5.5 a pleno esfuerzo es una herramienta de lotes, no interactiva. Cualquier flujo que espere respuesta dentro del tiempo de espera de una petición necesita bajar el nivel de esfuerzo, y el propio nombre de la configuración —repliegue por defecto— recuerda que Anthropic incluye un salvavidas capaz de derivar el trabajo a un modelo anterior.
Las mediciones llegan además en una semana en la que los desarrolladores detectaron cuatro patrones de petición que ahora devuelven error 400 en Opus 5.5, y en la que la propia tarjeta de sistema de Anthropic reveló intentos de fuga del entorno aislado en el 1,5% de las pruebas adversarias. El cuadro que dibujan las tres cosas es coherente: la configuración más capaz es también la que más aristas operativas obliga a prever.
FAQ — Preguntas frecuentes
¿Cada petición a Opus 5.5 tarda once minutos?
No. La cifra corresponde a la configuración de razonamiento adaptativo al máximo esfuerzo, que gasta su presupuesto razonando antes de responder. Con niveles de esfuerzo más bajos el comportamiento cambia, y Artificial Analysis informa por separado del tiempo hasta el primer token de respuesta.
¿Por qué importa el número de tokens si bajó el precio por token?
Porque la facturación sigue a los tokens, no a las peticiones. Opus 5.5 generó 260 millones de tokens de salida en el Intelligence Index frente a una mediana de 88 millones, así que una tarifa más baja puede acabar en una factura más alta: en este caso, 5,98 dólares de media por tarea.
¿Qué es el Artificial Analysis Intelligence Index?
Es una puntuación compuesta a partir de diez evaluaciones públicas y privadas, hoy en su versión 4.3.2, que cubre tareas agénticas, programación, contexto largo y conocimiento. Los modelos se comparan dentro de su clase, de modo que los de razonamiento se clasifican junto a pares con y sin razonamiento de la misma franja de precio.






