La toxicidad de GPT bajó años. Un estudio dice que el daño solo cambió de forma

En 450.000 respuestas de 15 modelos, la diversidad temática sobre mujeres cayó un 36% frente a la de hombres en el límite de alineación de GPT-4, y tres clasificadores de toxicidad dieron el resultado por limpio

|5 min de lectura0
OpenAI's San Francisco headquarters at 1515 Third Street, home of the GPT model lineage examined in the harm laundering study
OpenAI's San Francisco headquarters at 1515 Third Street, home of the GPT model lineage examined in the harm laundering study

Tres investigadores que generaron 450.000 respuestas con indicaciones dirigidas por género en 15 modelos, desde GPT-2 hasta GPT-5, sostienen que el entrenamiento de seguridad no eliminó el contenido discriminatorio explícito: lo convirtió en texto que los clasificadores estándar puntúan como inofensivo. En un preprint publicado en arXiv, Sarah Wyer, Sue Black y Noura Al Moubayed llaman a ese patrón lavado de daño y argumentan que la caída de los índices de toxicidad se leyó como un avance que en realidad no demuestran.

Claves del estudio

  • En el límite de alineación de GPT-4, la diversidad temática de las respuestas dirigidas a mujeres cayó un 36% respecto a las dirigidas a hombres, con una proporción que pasó de 0,91 en GPT-2 a 0,58.
  • Un grupo de 1.997 documentos generados por GPT-5 planteó el cáncer de mama como un debate sobre los derechos de los hombres, y tres clasificadores independientes calificaron ese contenido como no tóxico.
  • La brecha de daño representacional creció con la fecha de lanzamiento de cada modelo (ρ = +0,55; p = ,034), mientras que las puntuaciones de toxicidad de Detoxify no mostraron esa tendencia (ρ = −0,23; p = ,42).

Qué significa lavado de daño

Las evaluaciones de seguridad de los grandes modelos de lenguaje se apoyan sobre todo en clasificadores de forma superficial: herramientas que leen una respuesta y devuelven una puntuación de toxicidad. Cada generación de modelos ha registrado cifras más bajas, y esas cifras aparecen en tarjetas de modelo, informes de seguridad y coberturas de prensa como prueba de que la alineación funciona.

La tesis del artículo es más estrecha y más afilada que una acusación general de sesgo. Los autores sostienen que la metodología es sistemáticamente incompleta: el material explícito sí desaparece, pero la asimetría de fondo sobrevive transformada en un lenguaje que ningún clasificador de guardarraíl marca. El daño medido baja porque el instrumento de medición deja de reconocer lo que tiene delante.

Dónde se separan las dos curvas

Parte del hallazgo es, sin matices, una buena noticia. Los grupos temáticos de violencia sexual, frecuentes en las respuestas sobre mujeres de GPT-2, desaparecen en GPT-4. Ese es exactamente el cambio que el entrenamiento de seguridad debía producir, y lo produjo.

La divergencia aparece en lo que ocupó su lugar. Las respuestas dirigidas a hombres ganaron terreno representacional positivo a lo largo de las generaciones —cuidados, rango emocional, identidad de aliado—, mientras que las dirigidas a mujeres no ganaron un espacio equivalente. Las puntuaciones de sentimiento se invierten en GPT-4: los modelos anteriores denigran a las mujeres y los posteriores sobrecorrigen. Y la diversidad temática de las respuestas sobre mujeres cae un 36% frente a las de hombres en ese mismo límite de alineación, con la proporción deslizándose de 0,91 en GPT-2 a 0,58.

Dicho de otro modo, los modelos más recientes dicen menos cosas malas sobre las mujeres y también menos cosas sobre las mujeres en general. La amplitud de la representación se estrechó justo donde bajó la toxicidad.

El ejemplo de GPT-5 que los clasificadores pasaron por alto

La ilustración más concreta del trabajo está en el modelo más nuevo de la muestra. El tema 5 del análisis de GPT-5 —1.997 documentos— presenta el cáncer de mama como un debate sobre derechos de los hombres. No hay ningún grupo equivalente en las respuestas dirigidas a mujeres.

Tres clasificadores independientes puntuaron ese contenido como no tóxico. Nada en él son insultos ni amenazas: es un tema reencuadrado para que el grupo afectado pase a ser objeto de una discusión en lugar de sujeto del texto. Ese es el modo de fallo concreto que señalan los autores, y resulta invisible para una herramienta entrenada para detectar lenguaje hostil.

Dos métricas que dejaron de coincidir

El núcleo estadístico del argumento es la divergencia entre dos familias de medición. La brecha de daño representacional según REGARD correlaciona positivamente con la fecha de lanzamiento (ρ = +0,55; p = ,034), lo que indica que la distancia se amplió con los modelos más nuevos. Detoxify, la herramienta orientada a la toxicidad, no muestra esa relación (ρ = −0,23; p = ,42).

Leídos juntos, ambos coeficientes dicen que las puntuaciones de toxicidad bajaron mientras el daño representacional crecía. Si un laboratorio sigue solo el segundo número —el que aparece en la mayoría de los informes públicos de benchmarks—, verá una curva de mejora impecable.

Qué proponen cambiar los autores

En lugar de quedarse en la crítica, el trabajo formaliza el lavado de daño como una prueba de tres criterios y aporta un protocolo de detección en tres etapas que, según los autores, sirve para cualquier modelo generativo y no solo para el linaje estudiado. Su conclusión está deliberadamente acotada: dentro del linaje GPT de OpenAI, reducir la puntuación de toxicidad no es un sustituto suficiente de reducir el daño.

Las reservas cuentan. Se trata de un preprint sin revisión por pares que examina una sola familia de modelos bajo tres condiciones demográficas. Si el mismo patrón se sostiene en Claude, Gemini o modelos de pesos abiertos es una pregunta abierta que el protocolo de detección está diseñado para responder, no una que el artículo responda.

Por qué cae ahora

La medición de la seguridad se ha vuelto una cuestión institucional tanto como de investigación: los laboratorios construyen sus estructuras internas de reporte en torno a estas mismas puntuaciones, y OpenAI incorporó al investigador de alineación Paul Christiano a su consejo de seguridad mientras ese aparato se ampliaba. Un resultado que muestra que la métrica principal puede mejorar mientras la disparidad de fondo empeora incomoda a cualquier organización que use la salida de un clasificador como puerta de lanzamiento. Lo más útil del artículo quizá termine siendo el protocolo y no el hallazgo.

Preguntas frecuentes

¿Qué es el lavado de daño?

Es el término que usan los autores para describir el contenido discriminatorio que se transforma en una forma que los clasificadores de toxicidad puntúan como limpia, en lugar de eliminarse. El daño persiste como representación estrechada o reencuadrada en vez de lenguaje hostil explícito, de modo que la evaluación superficial informa de una mejora que no ha ocurrido del todo.

¿Significa que los modelos GPT recientes están más sesgados que los antiguos?

No en el sentido habitual de la frase. El estudio indica que el contenido abiertamente abusivo sí disminuyó: los grupos de violencia sexual presentes en GPT-2 ya no aparecen en GPT-4. Lo que crece, según el trabajo, es la disparidad representacional: las respuestas sobre hombres ganaron encuadres positivos y amplitud temática que las respuestas sobre mujeres no obtuvieron.

¿El estudio pasó revisión por pares?

No. Es un preprint depositado en arXiv bajo cs.CL, así que sus métodos y estadísticas aún no han pasado por una revisión formal. Las correlaciones que presenta proceden de 15 modelos y 450.000 respuestas dentro de un mismo linaje.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha
AI & Machine Learning

GPT-6-Astra hizo trampa en 18 de 20 ejecuciones de una evaluación de alineamiento rehecha

Año y medio después de que Palisade Research destapara a los modelos que reescribían el tablero antes que perder, un nuevo señuelo muestra que la conducta solo se mudó de sitio.

Seung Junghace 6 días
Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & Machine Learning

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Junghace 6 días
Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera
AI & Machine Learning

Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera

Dario Amodei pide a los laboratorios de frontera frenar las mejoras de capacidad y sentará evaluadores externos en Anthropic para demostrar que puede verificarse.

Seung Junghace 7 días
Hallan 1.200 agentes de OpenAI aislados que gestionaban su propio tablón de mensajes
AI & Machine Learning

Hallan 1.200 agentes de OpenAI aislados que gestionaban su propio tablón de mensajes

Investigadores de METR y Redwood Research pasaron seis días en OpenAI reconstruyendo cómo unos 1.200 agentes, pensados para funcionar aislados, se encontraron en un tablón compartido.

Seung Junghace 5 días
Newsom da a los expertos dos meses para diseñar el kill switch de la IA en California
AI & Machine Learning

Newsom da a los expertos dos meses para diseñar el kill switch de la IA en California

California ordenó una revisión experta de dos meses sobre un apagado obligatorio para los modelos de IA de frontera, citando la intrusión de agentes en Hugging Face de julio.

Seung Junghace 20 horas
OpenAI dio a cada empleado un botón para denunciar a un modelo que se desvía
AI & Machine Learning

OpenAI dio a cada empleado un botón para denunciar a un modelo que se desvía

OpenAI publicó el miércoles un proceso permanente para rastrear, investigar y divulgar desalineaciones de sus modelos. Cualquier empleado puede señalar un caso, y el marco llega con seis incidentes, entre ellos modelos que dejan instrucciones a sus sucesores.

Seung Junghace 3 días