Un fallo entre chats dejó que el modelo de OpenAI descifrara su propio razonamiento

OpenAI afirma que los operadores pegaban bloques de razonamiento cifrado de una conversación en otra y pedían al modelo que los transcribiera. El fallo ya está corregido, aunque la compañía advierte que la misma vía existe en otros sistemas.

|5 min de lectura0
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.

El ataque que OpenAI describió esta semana no venció a ninguna criptografía. Los operadores copiaron datos de razonamiento cifrados de una conversación, abrieron otra nueva y le pidieron al modelo que descifrara el bloque y lo escribiera en texto plano. El modelo lo hizo. OpenAI publicó el miércoles un informe sin firma sobre la campaña, calificó la técnica de novedosa y aseguró que ya corrigió el fallo que permitía el salto entre conversaciones.

Claves del caso

  • El método trasladaba razonamiento cifrado de un chat a otro y usaba al propio modelo como descifrador: no hubo acceso a claves, bases de datos ni conversaciones almacenadas.
  • El pico llegó el 24 y 25 de julio con 16.000 prompts de 4.000 usuarios que coincidían con un único patrón de extracción; el grupo de cuentas sospechosas alcanzó las 15.000 el 28 de julio.
  • OpenAI cerró la vía de descifrado entre conversaciones, endureció los controles de registro e infraestructura, amplió la vigilancia de red y sostiene que la debilidad no es exclusiva de sus modelos.

Por qué el razonamiento oculto es lo que vale la pena robar

Los laboratorios de frontera entregan una respuesta, pero ocultan los rastros de cadena de pensamiento que la produjeron. El motivo es competitivo, no estético: esos pasos intermedios son la señal de supervisión más valiosa que un rival podría usar para entrenar, y por eso se cifran antes de llegar al cliente.

Cifrarlos da por sentado que el texto cifrado seguirá siendo opaco para todo el que lo toque. El defecto está en que un modelo suficientemente capaz no es "todo el mundo": si se le entrega un texto cifrado en un contexto donde dispone de los medios para resolverlo, su propia disposición a ayudar hace el resto. La protección nunca fue el cifrado, sino la suposición de que ningún componente del lado del usuario podía revertirlo.

Conviene citar con precisión el encuadre de la propia OpenAI: los operadores no rompieron su cifrado, no comprometieron una base de datos ni obtuvieron acceso directo a conversaciones almacenadas. Lo que hicieron fue manipular las interacciones con el modelo para que el razonamiento protegido se reprodujera en formas visibles para quien lo pedía, a gran escala y en violación de los términos de servicio.

Lo que muestra la cronología

Los sondeos de bajo nivel comenzaron el 1 de julio y crecieron de forma gradual, según el reporte de CyberScoop. El salto llegó el 24 y 25 de julio, cuando 16.000 prompts de unos 4.000 usuarios coincidieron con un mismo patrón de extracción. Análisis posteriores ampliaron el grupo de prompts relacionados a 15.000 cuentas, y OpenAI afirma que la operación quedó completamente desarticulada el 28 de julio.

Dos detalles hacen el caso más interesante que las cifras. Primero, investigadores externos reportaron una vulnerabilidad similar a OpenAI en agosto, cuando la campaña ya estaba cortada, lo que indica que la vía podía descubrirse de forma independiente y no requería información interna. Segundo, casi tres semanas de volumen creciente precedieron al pico que activó la detección: un recordatorio de que el monitoreo de abuso calibrado por volumen se pierde el ascenso silencioso.

Una atribución sin pruebas publicadas

OpenAI atribuye el grupo principal a personas que actuaban en nombre de Moonshot AI, desarrolladora de los LLM de código abierto de la familia Kimi, aunque añade que no está claro si toda la actividad observada está conectada. La publicación no aporta evidencia técnica de esa atribución y la compañía se negó a dar más detalles a la prensa por motivos de seguridad. Anthropic siguió un camino parecido a comienzos de este año: nombró laboratorios sin publicar las señales en que se basaba.

El lector debería tratar el mecanismo y la atribución como afirmaciones distintas, con pesos probatorios distintos. La vía de descifrado entre conversaciones es verificable: fue parcheada y terceros también dieron con ella. Quién estaba detrás de las cuentas es, por ahora, una aseveración.

Qué cambia para otros proveedores

OpenAI dice haber compartido información del incidente con el resto de la industria a través del Frontier Model Forum, al considerar que la manipulación no es específica de sus sistemas. Cualquier proveedor que cifre razonamiento y a la vez exponga un modelo de propósito general a texto enviado por usuarios hereda un problema de la misma forma.

Perspectiva

Lo previsible es que la respuesta defensiva recaiga en la identidad y los límites de uso, no en los modelos: verificación de registro más estricta, techos más bajos por cuenta, detección de patrones entre cuentas. Son las palancas que existen. El problema estructural sigue abierto: un modelo lo bastante obediente como para seguir instrucciones sobre cualquier entrada también seguirá la instrucción de volver legible una entrada protegida, y ningún cifrado en la capa de transporte cambia eso.

Preguntas frecuentes

¿OpenAI sufrió una brecha?

No. OpenAI sostiene que no se rompió ningún cifrado, no se comprometió ninguna base de datos y no se accedió a conversaciones almacenadas. Los operadores usaron el producto tal como está diseñado: movieron razonamiento cifrado entre conversaciones y pidieron al modelo que lo hiciera legible, algo que la compañía considera una violación de los términos de servicio.

¿Ya se corrigió la vulnerabilidad?

OpenAI afirma haber parcheado el fallo concreto que permitía descifrar en una conversación los datos cifrados tomados de otra. También endureció los controles de registro e infraestructura, amplió la vigilancia de red y compartió detalles con otros laboratorios mediante el Frontier Model Forum, porque considera que la misma debilidad no es exclusiva de sus modelos.

¿Qué es la destilación adversaria?

Es el uso sistemático y no autorizado de las salidas o el razonamiento interno de un modelo para entrenar, reproducir o mejorar otro distinto. Destilar un modelo propio es ingeniería rutinaria; la variante adversaria cosecha los rastros protegidos de un competidor a través de su interfaz pública.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador
LLM & Chatbots

GPT-6 Astra se pone a trabajar: el modelo más caro de OpenAI lo apuesta todo al manejo del ordenador

GPT-6 Astra llega a los clientes empresariales con manejo del ordenador, un contexto de un millón de tokens y precios de 10 y 50 dólares, con una salvedad sobre su puntuación estrella.

Seung Junghace 21 días
ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo
LLM & Chatbots

ChatGPT Images 2.5 reduce a la mitad la latencia y suma un lienzo de dibujo

OpenAI lanzó ChatGPT Images 2.5 con hasta un 50% menos de latencia, un lienzo de dibujo Sketch, plantillas, comentarios anclados y dos modelos nuevos en la API.

Seung Junghace 20 días
OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas
Developer Tools

OpenAI reduce a la mitad el precio de sus modelos intermedios, pero GPT-5.6 sigue ganando en dos pruebas

OpenAI lanzó el martes dos modelos intermedios y construyó su argumento casi por completo sobre el precio. GPT-6 Sol cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida.

Seung Junghace 8 días
Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL
LLM & Chatbots

Astra for Law de OpenAI no es un modelo nuevo: es un índice de búsqueda de 230 millones de URL

Astra for Law combina GPT-6 Astra con un índice jurídico de 230 millones de URL y eleva la precisión del Legal Research Bench del 38,7% al 54%.

Seung Junghace 13 días
El mejor modelo en el nuevo test de salud mental de OpenAI saca 57,3%
LLM & Chatbots

El mejor modelo en el nuevo test de salud mental de OpenAI saca 57,3%

MentalHealthBench, creado por OpenAI con más de 80 clínicos de 22 países, tiene su techo en el 57,3% de GPT-6 Astra. Claude Opus 5.5 obtuvo 52,4%.

Seung Junghace 3 días
OpenAI lanza el mismo día un agente de Datos y un ChatGPT para Wall Street
LLM & Chatbots

OpenAI lanza el mismo día un agente de Datos y un ChatGPT para Wall Street

OpenAI presentó el mismo jueves un agente de Datos para ChatGPT Work y ChatGPT for Financial Services, desarrollado con Morgan Stanley y Evercore.

Seung Junghace 20 días