Sonnet 5.5 devuelve a Sonnet 5 las consultas de ciberseguridad bloqueadas, y en la API hay que activarlo

Las pruebas de la propia Anthropic sitúan la tasa de vulneración por inyección del tráfico redirigido unas 175 veces por encima de la de las consultas que responde Sonnet 5.5

|5 min de lectura0
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5

La línea más riesgosa del material de lanzamiento de Claude Sonnet 5.5 no es una cifra de capacidad, sino una regla de enrutamiento: cuando un clasificador bloquea una consulta de ciberseguridad, la plataforma puede responderla con el antiguo Sonnet 5, y las pruebas de inyección de prompts de la propia Anthropic encontraron que ese tráfico redirigido resulta mucho más fácil de vulnerar. The New Stack detalló primero en qué se diferencia el comportamiento entre las aplicaciones de Claude y la API.

Claves

  • Las aplicaciones de Claude redirigen automáticamente a Sonnet 5 las consultas de ciberseguridad bloqueadas, mientras que quienes usan la API deben activar el respaldo por su cuenta: con la opción desactivada, la consulta bloqueada falla en lugar de ser respondida.
  • En las pruebas en entornos de programación de Anthropic se vulneró el 12,01% de las consultas redirigidas, frente a cuatro de las 5.901 que respondió Sonnet 5.5 por sí mismo, una brecha de alrededor de dos órdenes de magnitud.
  • Sonnet 5.5 es el primer modelo de la gama Sonnet que se lanza bajo la política de ciberseguridad que Anthropic aplicaba solo a Opus.

Qué cambia en el recorrido de la consulta

Hay dos novedades, y solo una es visible en una tarjeta de modelo. La primera es el bloqueo en sí: un conjunto acotado de consultas de ciberseguridad, junto con una categoría reducida ligada al desarrollo de modelos de frontera —como el trabajo sobre kernels para determinados aceleradores de aprendizaje automático—, puede rechazarse de plano.

La segunda es lo que ocurre después. Dentro de las aplicaciones de Anthropic, una consulta rechazada se reintenta en Sonnet 5 y el usuario ve un aviso con el nombre del modelo que respondió. En la API ese reintento no existe hasta que el desarrollador lo habilita. Para quien trate el lanzamiento como un cambio de versión en un archivo de configuración, ahí está la trampa: una canalización que funcionaba con Sonnet 5 puede empezar a devolver errores con esos mismos prompts cercanos a la seguridad.

Por qué el respaldo es una decisión de seguridad y no de disponibilidad

Activar el respaldo parece una ganancia directa en disponibilidad. Las cifras de Anthropic dicen otra cosa. En las pruebas de inyección de prompts en entornos de programación, una cuarta parte de las consultas dirigidas a Sonnet 5.5 terminó atendida por Sonnet 5 tras activar el clasificador, a menudo porque las instrucciones inyectadas para borrar discos o eliminar archivos se parecen justo a la conducta que ese clasificador existe para frenar.

De esa porción redirigida, el 12,01% fue vulnerado con éxito. Sonnet 5.5, respondiendo por su cuenta, fue vulnerado cuatro veces en 5.901 intentos, cerca del 0,07%. Dicho sin rodeos: activar el respaldo puede enviar una cuarta parte del tráfico adversario a un modelo que falló las pruebas de inyección a una tasa más de cien veces superior a la del modelo elegido. Una prueba independiente de inyección indirecta del proveedor de guardrail Gray Swan no mostró caída alguna con el respaldo activado, así que el efecto no es uniforme entre conjuntos de pruebas.

El salto de capacidad que activó la política

Nada de esto se aplicó por precaución abstracta. Según las cifras publicadas por Anthropic, Sonnet 5.5 obtiene un 70,6% en la prueba de programación agéntica Terminal-Bench 4.0, frente al 10,3% de Sonnet 5 y el 66,4% del más caro Opus 5.5, con un precio que no varía: 2 dólares por millón de tokens de entrada y 10 por millón de salida.

Las mejoras en seguridad ofensiva fueron más pronunciadas. Con las salvaguardas desactivadas, la tarjeta del sistema registra ejecución completa de código arbitrario en 178 de 410 ejecuciones de ExploitBench. En CyScenarioBench, de Irregular, el modelo completó el 46,1% de los desafíos donde Sonnet 5 alcanzó el 0,7%, y en una prueba de explotación de binarios derivada del corpus OSS-Fuzz de Google produjo 50 secuestros del flujo de control frente a tres. Anthropic sigue situándolo por debajo de Opus 5.5 en capacidad de ciberseguridad; la distancia respecto del Sonnet anterior bastó para arrastrar la política de la gama Opus a un escalón de precio inferior.

Cómo se aplica el bloqueo

Deciden tres componentes. Una sonda inspecciona las activaciones internas del modelo, un clasificador ligero corre sobre el propio Sonnet 5.5 y un clasificador LLM entrenado aparte pondera el veredicto de la sonda antes de cortar una conversación. Anthropic describe su detección de ciberseguridad como comparable a la de Opus 5, con una protección contra jailbreak deliberadamente más laxa, y advierte a los usuarios que habrá más rechazos que con Sonnet 5, incluido el trabajo de seguridad legítimo. Un representante de la empresa citó las pruebas de penetración, la generación de exploits y el escaneo de vulnerabilidades en binarios como ejemplos dentro del alcance.

Qué resolver antes de actualizar

  1. Decidir la configuración del respaldo de forma deliberada y documentarla como una elección de seguridad, no como una política de reintentos.
  2. Registrar qué modelo respondió cada consulta; según Anthropic, las respuestas redirigidas se identifican solas.
  3. Repetir las pruebas de inyección contra Sonnet 5, y no solo contra el modelo elegido nominalmente.

El ajuste del clasificador para reducir los falsos positivos continúa, y los defensores verificados accederán con menos restricciones mediante un Cyber Verification Program ampliado al que Sonnet 5.5 no se había sumado en el lanzamiento. Nuestro informe anterior cubrió el lado de las pruebas comparativas de ese mismo lanzamiento.

FAQ Preguntas frecuentes

¿El respaldo a Sonnet 5 viene activado por defecto?

En la API no. Las aplicaciones Claude de Anthropic reintentan automáticamente en Sonnet 5 las consultas de ciberseguridad bloqueadas, pero quienes desarrollan sobre la API deben activar el respaldo, y las plataformas de terceros pueden comportarse de otra manera. Con la opción desactivada, la consulta bloqueada falla en lugar de redirigirse.

¿El trabajo de programación habitual chocará con estas salvaguardas?

Anthropic afirma que la mayoría de las consultas no lo hará y que el desarrollo de software rutinario no se ve afectado. La política apunta a tareas de ciberseguridad de mayor riesgo, como las pruebas de penetración y la generación de exploits, aunque la empresa también advierte de más rechazos que con Sonnet 5 en trabajo de seguridad legítimo.

¿Sonnet 5.5 cuesta más que Sonnet 5?

No. El precio es idéntico: 2 dólares por millón de tokens de entrada y 10 por millón de salida. Anthropic sostiene que el modelo suele necesitar menos tokens por tarea, lo que deja el costo efectivo hasta un 30% por debajo del de su predecesor.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Claude Code Projects vuelve como un coordinador que ejecuta hilos en la nube en paralelo
Developer Tools

Claude Code Projects vuelve como un coordinador que ejecuta hilos en la nube en paralelo

El rediseño de Claude Code Projects coloca un coordinador por encima de los hilos de trabajo, cada uno una sesión completa en la nube con su rama y memoria compartida.

Seung Junghace 12 días
Un millón de skills para agentes en siete meses, y casi la mitad se instaló una sola vez
Developer Tools

Un millón de skills para agentes en siete meses, y casi la mitad se instaló una sola vez

El registro skills.sh de Vercel llegó a un millón de skills en siete meses. Casi la mitad se instaló una sola vez y 375 fichas concentran el 62% de las instalaciones.

Seung Junghace 3 días
Unos investigadores llegaron al repositorio interno de OpenAI por un fallo de imágenes en un foro
Developer Tools

Unos investigadores llegaron al repositorio interno de OpenAI por un fallo de imágenes en un foro

Hacktron AI encadenó un desbordamiento en libheif con una falla del SSO de OpenAI para alcanzar cuentas de Codex de empleados y el monorepo openai/openai. Ambos fallos ya están corregidos.

Seung Junghace 11 días
Cuatro peticiones válidas en Opus 5 ahora devuelven 400 en Claude Opus 5.5
Developer Tools

Cuatro peticiones válidas en Opus 5 ahora devuelven 400 en Claude Opus 5.5

Claude Opus 5.5 cuesta un 20% menos que Opus 5 y devuelve HTTP 400 en cuatro peticiones que Opus 5 aceptaba. Un quinto cambio silencia el progreso del agente.

Seung Jungayer
3.000 cambios fusionados y cero reversiones: así fue el sprint de dos semanas de Anthropic
Developer Tools

3.000 cambios fusionados y cero reversiones: así fue el sprint de dos semanas de Anthropic

Anthropic redujo en agosto el tiempo p75 hasta poder escribir en claude.ai de 3,1 a 0,55 segundos y fusionó 3.000 cambios sin una sola reversión al condicionar la CI al recuento de instrucciones.

Seung Junghace 5 días
La migración de Bun de Zig a Rust tomó 11 días y 64 agentes en paralelo
Developer Tools

La migración de Bun de Zig a Rust tomó 11 días y 64 agentes en paralelo

El entorno de ejecución de Bun pasó de Zig a Rust en una migración de 11 días dirigida por agentes. Los errores de memoria desaparecieron; los de significado, no.

Seung Junghace 9 días