Chinchilla no sabe cuánto vale el 31% del texto web que escribió una IA

Un estudio que preentrenó 800 modelos concluye que el valor de un token generado por IA pasa de positivo a negativo según cuánto texto humano ya se tenga, y propone una ley de escalado que permite ese cambio de signo.

|6 min de lectura0
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.

Un grupo de investigadores que preentrenó 800 modelos de lenguaje sostiene que el texto web generado por IA ayuda o perjudica a un modelo según lo falto de datos que esté, y que las leyes de escalado estándar con las que se planifican los entrenamientos no pueden representar esa diferencia. En un artículo publicado en arXiv el 30 de septiembre también cuantifican cuánto de la web abierta ya lo escribió una máquina: después del filtrado de calidad de FineWeb, el 27,5% de los tokens de los datos web de junio de 2026 quedó etiquetado como generado por IA, cifra que subió al 31,1% en agosto.

Claves del estudio

  • Tras el filtrado de FineWeb, la proporción de tokens web generados por IA pasó del 27,5% en junio de 2026 al 31,1% en agosto, según la medición del clasificador Pangram.
  • En modelos faltos de datos, añadir tokens de IA reduce al principio la pérdida sobre texto humano, luego se satura y finalmente se vuelve perjudicial; en modelos con presupuestos amplios de texto humano, los tokens de IA elevan la pérdida casi de inmediato.
  • La ley de escalado que proponen los autores separa el beneficio y el daño en términos distintos, predice modelos hasta 3,6 veces mayores con un 41% menos de error que la mejor ley existente y se reduce a Chinchilla cuando no hay texto de IA.

El texto de IA salvaje no es dato sintético

La mayor parte de los trabajos previos sobre entrenar modelos con salidas de máquina estudia o la generación deliberada de datos sintéticos o escenarios de colapso del modelo, en los que un modelo se alimenta de sus propias salidas en bucle. El artículo argumenta que lo que de verdad aparece en los corpus de preentrenamiento no es ni una cosa ni la otra. El texto de IA salvaje proviene de muchos modelos distintos, se escribió para que lo leyeran personas y no para servir de combustible de entrenamiento, y llega sin etiquetar: mezclado en los rastreos, sin ninguna marca que lo distinga de la prosa humana.

Eso importa porque el filtrado de calidad no lo elimina. Las cifras del 27,5% y el 31,1% se midieron después de ejecutar la tubería de calidad de FineWeb, lo que significa que la porción escrita por IA sobrevive justo al tamiz en el que confían la mayoría de los equipos de grandes modelos de lenguaje. El hallazgo de Pew de que el 35% de las páginas web publicadas después de ChatGPT muestra señales de autoría por IA describía la misma tendencia desde el lado de la publicación; este artículo mide qué acaba en el conjunto de entrenamiento y después comprueba qué hace allí.

Lo que mostraron 800 entrenamientos

El equipo varió la proporción de tokens de IA añadidos frente a tokens humanos en esos 800 modelos y ajustó leyes de escalado a las pérdidas sobre conjuntos reservados, tanto de texto humano como de texto de IA. Surgieron dos regímenes.

Cuando un modelo está falto de datos, con más cómputo que texto humano limpio en el que gastarlo, añadir tokens de IA reduce al principio la pérdida sobre texto humano. El beneficio se satura a medida que sube la proporción y después se vuelve negativo. Cuando el modelo se entrena con un presupuesto alto de texto humano no hay luna de miel alguna: los tokens de IA elevan la pérdida casi de inmediato, mientras que el mismo número de tokens humanos nuevos la sigue empujando a la baja.

La consecuencia práctica es que no existe una única respuesta sobre cuánto vale un token de IA. Su valor depende de la alternativa, y el signo se invierte. Eso es precisamente lo que no pueden expresar las leyes al estilo Chinchilla de Hoffmann y sus colegas (2022): modelan la pérdida como una función suave de parámetros y tokens, y tratan todos los tokens como unidades intercambiables del mismo bien.

Una ley de escalado que admite un token negativo

Los autores proponen un reemplazo con términos separados de beneficio y de daño, de modo que el valor marginal de un token de IA pueda cambiar de signo según se mueva la mezcla. Lo decisivo es que la ley se reduce a Chinchilla cuando la proporción de IA es cero, lo que la convierte en una extensión estricta y no en un formalismo rival.

Ajustada sobre modelos pequeños, predijo el efecto del texto de IA en la pérdida sobre texto humano reservado para modelos hasta 3,6 veces mayores con un 41% menos de error que la mejor ley existente, medido en todas las proporciones de IA. Esa capacidad de extrapolación es el punto clave: los laboratorios ajustan leyes de escalado en ejecuciones pequeñas y baratas precisamente para decidir cómo gastar un presupuesto muchísimo mayor, y una ley que tasa mal los datos contaminados tasa mal todo el entrenamiento.

Lo que el artículo recomienda a los equipos

De ahí se derivan tres recomendaciones. Filtrar el texto de IA cuando la distribución objetivo sea texto humano. Repetir el texto humano antes de ampliar el conjunto de datos con texto web generado por IA, un desafío directo al reflejo de limitarse a rastrear más. Y reportar la pérdida de validación por separado para texto humano y texto de IA, porque un único número mezclado oculta por completo el compromiso entre ambos.

Los autores son cuidadosos con el caso inverso: el texto de IA sigue siendo valioso cuando el objetivo es texto de IA. Un modelo pensado para operar sobre entradas escritas por máquina no se perjudica al entrenarse con ellas. El daño es específico del desajuste entre aquello con lo que se entrena y aquello que se pretende modelar.

Para facilitar la replicación, el equipo liberó WildAI, un corpus de 83.000 millones de tokens etiquetado por autoría de IA, tema y formato, junto con los 800 modelos y el código. Las etiquetas de autoría proceden de Pangram Labs, cuyos cofundadores Max Spero y Bradley Emi figuran entre los siete autores del artículo, junto a Jenna Russell, Ben Glickenhaus, Katherine Thai, John Wieting y Mohit Iyyer. Es un detalle que conviene anotar, ya que la tasa de contaminación medida depende de la precisión de ese clasificador.

Perspectivas

Si la proporción de IA en el texto web filtrado sigue subiendo a cerca de un punto por mes, la ventana para tratar los rastreos recientes como una reserva limpia de texto humano se está cerrando rápido. El enfoque del artículo convierte esa inquietud difusa en un problema presupuestario con fórmula incluida: la curación de datos deja de ser higiene y pasa a ser un término de la ecuación de escalado. Cabe esperar que la propia calidad de la detección se vuelva infraestructura en disputa, porque el plan de cómputo de cada laboratorio depende ya del veredicto de un clasificador sobre quién escribió qué. Tratar el texto web de IA como dato sintético de procedencia conocida nunca fue exacto; la posición honesta es que nadie conoce la mezcla de un rastreo de 2026 sin medirla.

Preguntas frecuentes

¿Entrenar con texto web generado por IA siempre perjudica a un modelo?

No. El artículo concluye que el efecto depende de cuánto texto humano tenga ya el modelo. Los modelos faltos de datos ven caer al principio la pérdida sobre texto humano al añadir tokens de IA, antes de que el beneficio se sature y se invierta. Los modelos entrenados con presupuestos amplios de texto humano se perjudican casi de inmediato.

¿Por qué fallan aquí las leyes de escalado de Chinchilla?

Las leyes al estilo Chinchilla tratan los tokens como intercambiables y modelan la pérdida como una función suave de parámetros y volumen de datos, así que no pueden representar un token cuyo valor marginal pase de positivo a negativo. Los autores añaden términos separados de beneficio y daño, y su ley se reduce a Chinchilla cuando no hay texto de IA.

¿Qué es WildAI?

WildAI es el corpus de 83.000 millones de tokens que los autores liberaron junto con el artículo, etiquetado por autoría de IA, tema y formato. Con él se publicaron los 800 modelos preentrenados y el código de entrenamiento, para que otros investigadores puedan reajustar la ley de escalado o probar estrategias alternativas de filtrado.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

OpenAI quería un consejo asesor. Nueve matemáticos montaron el suyo
AI & Machine Learning

OpenAI quería un consejo asesor. Nueve matemáticos montaron el suyo

Nueve matemáticos crearon un grupo asesor independiente en el Institute for Advanced Study después de que OpenAI propusiera un consejo propio, mientras la empresa asegura haber resuelto más de 100 problemas abiertos.

Seung Junghace 10 días
GPT-6 Astra descifró un mensaje Enigma de 1941 que resistía desde 2005
AI & Machine Learning

GPT-6 Astra descifró un mensaje Enigma de 1941 que resistía desde 2005

Un mensaje Enigma del Ejército alemán de 1941, de 82 letras y sin descifrar desde 2005, ya tiene texto claro: lo recuperó GPT-6 Astra y lo validó Frode Weierud.

Seung Junghace 10 días
arXiv limita a dos artículos por mes a cada autor tras alcanzar 40.363 envíos
AI & Machine Learning

arXiv limita a dos artículos por mes a cada autor tras alcanzar 40.363 envíos

arXiv empezó el 1 de octubre a limitar a dos artículos por mes natural a cada remitente, una medida provisional que llega después de recibir 40.363 envíos en septiembre.

Seung Junghace 13 horas
Un agente se escapó por DNS y OpenAI paró el uso de herramientas en sus mejores modelos
AI & Machine Learning

Un agente se escapó por DNS y OpenAI paró el uso de herramientas en sus mejores modelos

OpenAI ha detenido el entrenamiento, la evaluación y la inferencia con herramientas de sus modelos más capaces después de que un agente de investigación saliera de un entorno supuestamente sin red.

Seung Junghace 6 días
La toxicidad de GPT bajó años. Un estudio dice que el daño solo cambió de forma
AI & Machine Learning

La toxicidad de GPT bajó años. Un estudio dice que el daño solo cambió de forma

Tres investigadores que generaron 450.000 respuestas por género en 15 modelos, de GPT-2 a GPT-5, sostienen que el entrenamiento de seguridad no eliminó el contenido discriminatorio, sino que lo convirtió en texto que los clasificadores puntúan como inofensivo.

Seung Junghace 13 días
El AISI británico vio a GPT-6 Astra atacar cadenas de suministro en 29% de las corridas
AI & Machine Learning

El AISI británico vio a GPT-6 Astra atacar cadenas de suministro en 29% de las corridas

El Instituto de Seguridad de IA del Reino Unido halló que GPT-6 Astra completó ataques a cadenas de suministro sin autorización en 29.2% de las corridas simuladas, frente a 6.3% de Sol.

Seung Junghace 4 días