Un equipo de 51 físicos y científicos de la computación reexaminó seis benchmarks de física de uso extendido y concluyó que las bajas puntuaciones que obtienen allí los modelos de frontera miden sobre todo a los benchmarks, no a los modelos. Después de que los expertos corrigieran soluciones de referencia defectuosas y repararan o eliminaran preguntas con fallos, la puntuación mean@4 de GPT-5.6-Sol en HLE-Physics subió del 47,3 % al 78,7 %.
Claves del informe
- En HLE-Physics, el mean@4 de GPT-5.6-Sol pasó del 47,3 % al 78,7 % tras la recalificación experta; en CMT-Benchmark subió del 61,0 % al 87,2 %.
- El pass@4 corregido alcanzó el 94,4 % en los 54 problemas de CritPt que superaron la revisión experta, un nivel que los autores describen como cercano a la saturación.
- El artículo rebate de forma directa la impresión que dejaron las bajas notas de física del Artificial Analysis Intelligence Index (2026): la mayoría de los errores auditados fueron artefactos de calificación y no fallos de razonamiento.
Qué hicieron realmente los auditores
El estudio, publicado como arXiv:2609.13009, nació de un desajuste que sus autores detectaban una y otra vez. Los resultados publicados de los benchmarks indicaban que los modelos de frontera seguían atascados en física avanzada. Los físicos que usan esos mismos modelos en su investigación contaban otra cosa.
En lugar de discutir a partir de anécdotas, el equipo ejecutó modelos de frontera en los seis benchmarks y puso los resultados ante especialistas del área. Profesores e investigadores de posgrado con experiencia en cada subcampo leyeron el enunciado, la solución de referencia y la respuesta del modelo en cada caso, con el alcance limitado a problemas de solo texto y respuesta final verificable.
Su tarea consistía en clasificar los fallos en cuatro categorías: errores reales del modelo, errores de calificación, soluciones de referencia incorrectas y preguntas demasiado ambiguas o mal especificadas como para tener una respuesta defendible. El hallazgo central es que la mayoría de los casos calificados inicialmente como incorrectos cayó en las tres últimas.
Por qué las notas corregidas se movieron tanto
Una vez que los expertos arreglaron las soluciones de referencia erróneas y repararon o excluyeron las preguntas rotas, las puntuaciones subieron con fuerza en todos los frentes. Los dos mayores saltos documentados corresponden a GPT-5.6-Sol: HLE-Physics del 47,3 % al 78,7 % y CMT-Benchmark del 61,0 % al 87,2 %, ambos medidos como mean@4.
En CritPt, el pass@4 corregido llegó al 94,4 % sobre los 54 problemas conservados tras la revisión. Los autores señalan que los subconjuntos auditados de UGPhysics, PRISM-Physics y PHYBench también subieron de forma notable. El matiz importa: las notas corregidas se calculan solo sobre los subconjuntos conservados, de modo que describen el rendimiento en los problemas que superaron el escrutinio experto, no en los conjuntos completos originales.
El problema de medición que esto deja al descubierto
El resultado aterriza en una disputa abierta sobre qué miden realmente las tablas públicas de grandes modelos de lenguaje. Si las respuestas de referencia de un benchmark están mal, un modelo que razona correctamente pierde puntos, y el índice agregado construido sobre ese benchmark propaga el error a todo el que lo lea.
Ese modo de fallo no es exclusivo de la física. El andamiaje de la evaluación ha demostrado una y otra vez ser la variable que mueve las notas: el harness AVO de Nvidia llevó a Claude Opus 5 del 30 % a una ronda perfecta en ARC-AGI-3 sin tocar el modelo. Aquí el andamiaje bajo examen es la calificación misma.
Qué viene después de la saturación
Los autores no presentan las cifras corregidas como una reivindicación general de la capacidad de los modelos. Su conclusión es más estrecha y más afilada: los benchmarks actuales subestiman de forma sustancial lo que los modelos de frontera pueden hacer en problemas de física bien planteados y de respuesta cerrada, y ese tipo de problemas está casi agotado como fuente de señal.
Eso empuja al campo hacia evaluaciones más duras y validadas por expertos: tareas de investigación abiertas, sin una respuesta final verificable, en las que un especialista debe juzgar el razonamiento en lugar de comprobar un número. Construirlas cuesta bastante más que recolectar colecciones de problemas, y ahí está parte de la razón por la que las defectuosas siguieron circulando.
Preguntas frecuentes
¿Qué benchmarks de física se auditaron?
Seis: HLE-Physics, CMT-Benchmark, CritPt, UGPhysics, PRISM-Physics y PHYBench. La auditoría cubrió problemas de solo texto con respuesta final verificable, y las notas corregidas se calcularon sobre los subconjuntos conservados tras la revisión experta.
¿Significa esto que los modelos de frontera ya resolvieron la física?
No. Lo que sostiene el artículo es que los modelos están cerca de la saturación en problemas de física cerrados con respuesta verificable, una porción estrecha del trabajo en física. Los autores piden explícitamente evaluaciones más exigentes y validadas por expertos en lugar de dar el problema por resuelto.
Si las notas originales estaban mal, ¿por qué importan?
Porque los índices agregados las repiten. Las bajas puntuaciones de física del Artificial Analysis Intelligence Index (2026) moldearon la lectura pública sobre el razonamiento de los modelos; si la calificación de base era defectuosa, esa lectura también lo era.






