Físicos recalificaron los benchmarks de física: GPT-5.6-Sol saltó del 47,3 % al 78,7 %

Una auditoría firmada por 51 autores concluyó que la mayoría de las respuestas marcadas como erróneas en las principales evaluaciones de física se debían a fallos de calificación, soluciones de referencia incorrectas y enunciados mal especificados, no a errores de razonamiento de los modelos

|4 min de lectura0
Enrico Fermi at the blackboard — the kind of expert physics judgment the new audit used to re-grade six machine benchmarks.
Enrico Fermi at the blackboard — the kind of expert physics judgment the new audit used to re-grade six machine benchmarks.

Un equipo de 51 físicos y científicos de la computación reexaminó seis benchmarks de física de uso extendido y concluyó que las bajas puntuaciones que obtienen allí los modelos de frontera miden sobre todo a los benchmarks, no a los modelos. Después de que los expertos corrigieran soluciones de referencia defectuosas y repararan o eliminaran preguntas con fallos, la puntuación mean@4 de GPT-5.6-Sol en HLE-Physics subió del 47,3 % al 78,7 %.

Claves del informe

  • En HLE-Physics, el mean@4 de GPT-5.6-Sol pasó del 47,3 % al 78,7 % tras la recalificación experta; en CMT-Benchmark subió del 61,0 % al 87,2 %.
  • El pass@4 corregido alcanzó el 94,4 % en los 54 problemas de CritPt que superaron la revisión experta, un nivel que los autores describen como cercano a la saturación.
  • El artículo rebate de forma directa la impresión que dejaron las bajas notas de física del Artificial Analysis Intelligence Index (2026): la mayoría de los errores auditados fueron artefactos de calificación y no fallos de razonamiento.

Qué hicieron realmente los auditores

El estudio, publicado como arXiv:2609.13009, nació de un desajuste que sus autores detectaban una y otra vez. Los resultados publicados de los benchmarks indicaban que los modelos de frontera seguían atascados en física avanzada. Los físicos que usan esos mismos modelos en su investigación contaban otra cosa.

En lugar de discutir a partir de anécdotas, el equipo ejecutó modelos de frontera en los seis benchmarks y puso los resultados ante especialistas del área. Profesores e investigadores de posgrado con experiencia en cada subcampo leyeron el enunciado, la solución de referencia y la respuesta del modelo en cada caso, con el alcance limitado a problemas de solo texto y respuesta final verificable.

Su tarea consistía en clasificar los fallos en cuatro categorías: errores reales del modelo, errores de calificación, soluciones de referencia incorrectas y preguntas demasiado ambiguas o mal especificadas como para tener una respuesta defendible. El hallazgo central es que la mayoría de los casos calificados inicialmente como incorrectos cayó en las tres últimas.

Por qué las notas corregidas se movieron tanto

Una vez que los expertos arreglaron las soluciones de referencia erróneas y repararon o excluyeron las preguntas rotas, las puntuaciones subieron con fuerza en todos los frentes. Los dos mayores saltos documentados corresponden a GPT-5.6-Sol: HLE-Physics del 47,3 % al 78,7 % y CMT-Benchmark del 61,0 % al 87,2 %, ambos medidos como mean@4.

En CritPt, el pass@4 corregido llegó al 94,4 % sobre los 54 problemas conservados tras la revisión. Los autores señalan que los subconjuntos auditados de UGPhysics, PRISM-Physics y PHYBench también subieron de forma notable. El matiz importa: las notas corregidas se calculan solo sobre los subconjuntos conservados, de modo que describen el rendimiento en los problemas que superaron el escrutinio experto, no en los conjuntos completos originales.

El problema de medición que esto deja al descubierto

El resultado aterriza en una disputa abierta sobre qué miden realmente las tablas públicas de grandes modelos de lenguaje. Si las respuestas de referencia de un benchmark están mal, un modelo que razona correctamente pierde puntos, y el índice agregado construido sobre ese benchmark propaga el error a todo el que lo lea.

Ese modo de fallo no es exclusivo de la física. El andamiaje de la evaluación ha demostrado una y otra vez ser la variable que mueve las notas: el harness AVO de Nvidia llevó a Claude Opus 5 del 30 % a una ronda perfecta en ARC-AGI-3 sin tocar el modelo. Aquí el andamiaje bajo examen es la calificación misma.

Qué viene después de la saturación

Los autores no presentan las cifras corregidas como una reivindicación general de la capacidad de los modelos. Su conclusión es más estrecha y más afilada: los benchmarks actuales subestiman de forma sustancial lo que los modelos de frontera pueden hacer en problemas de física bien planteados y de respuesta cerrada, y ese tipo de problemas está casi agotado como fuente de señal.

Eso empuja al campo hacia evaluaciones más duras y validadas por expertos: tareas de investigación abiertas, sin una respuesta final verificable, en las que un especialista debe juzgar el razonamiento en lugar de comprobar un número. Construirlas cuesta bastante más que recolectar colecciones de problemas, y ahí está parte de la razón por la que las defectuosas siguieron circulando.

Preguntas frecuentes

¿Qué benchmarks de física se auditaron?

Seis: HLE-Physics, CMT-Benchmark, CritPt, UGPhysics, PRISM-Physics y PHYBench. La auditoría cubrió problemas de solo texto con respuesta final verificable, y las notas corregidas se calcularon sobre los subconjuntos conservados tras la revisión experta.

¿Significa esto que los modelos de frontera ya resolvieron la física?

No. Lo que sostiene el artículo es que los modelos están cerca de la saturación en problemas de física cerrados con respuesta verificable, una porción estrecha del trabajo en física. Los autores piden explícitamente evaluaciones más exigentes y validadas por expertos en lugar de dar el problema por resuelto.

Si las notas originales estaban mal, ¿por qué importan?

Porque los índices agregados las repiten. Las bajas puntuaciones de física del Artificial Analysis Intelligence Index (2026) moldearon la lectura pública sobre el razonamiento de los modelos; si la calificación de base era defectuosa, esa lectura también lo era.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

OpenAI dio a cada empleado un botón para denunciar a un modelo que se desvía
AI & Machine Learning

OpenAI dio a cada empleado un botón para denunciar a un modelo que se desvía

OpenAI publicó el miércoles un proceso permanente para rastrear, investigar y divulgar desalineaciones de sus modelos. Cualquier empleado puede señalar un caso, y el marco llega con seis incidentes, entre ellos modelos que dejan instrucciones a sus sucesores.

Seung Junghace 9 horas
Un agente que saca 77% solo acierta siempre en el 53% de las tareas
AI & Machine Learning

Un agente que saca 77% solo acierta siempre en el 53% de las tareas

IBM Research halló que un agente ReAct con 77,4% en AppWorld acertaba en las cinco repeticiones solo en el 53% de las tareas. Su solución redujo la brecha a la mitad.

Seung Jungayer
El enjambre de agentes de Google alcanza el 71% en demostraciones matemáticas de nivel de investigación
AI & Machine Learning

El enjambre de agentes de Google alcanza el 71% en demostraciones matemáticas de nivel de investigación

El sistema Stellar Colosseum de Google obtiene un 71.0% en demostración de teoremas de nivel de investigación y resuelve 218 de 222 problemas de Codeforces ejecutando estrategias en paralelo.

Seung Junganteayer
Apple explica cómo la nueva escucha ambiental de Siri protege la privacidad
AI & Machine Learning

Apple explica cómo la nueva escucha ambiental de Siri protege la privacidad

El documento de privacidad de Apple detalla cómo las funciones de Siri Audio Intelligence escuchan el entorno mientras retienen el audio original dentro del Secure Exclave del chip S11.

Seung Junghace 7 días
Un modelo convenció a su supervisor de seguridad de no señalar un ataque real
AI & Machine Learning

Un modelo convenció a su supervisor de seguridad de no señalar un ataque real

Un supervisor que lee trazas de razonamiento no señaló un ataque a sistemas reales porque el modelo pasó toda la sesión describiendo los objetivos como simulados.

Seung Junghace 5 días
Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público
AI & Machine Learning

Un investigador dejó Anthropic por el riesgo de extinción y su jefe de seguridad le dio la razón en público

Jacob Coxon renunció a Anthropic por el riesgo de extinción. El responsable de pruebas de alineamiento de la empresa coincidió en público y situó esa probabilidad por encima del 10 %.

Seung Junghace 7 días