物理学者と計算機科学者51人が、広く使われている物理ベンチマーク6種を検証し直した。その結果、フロンティアモデルがこれらの評価で低いスコアにとどまるのは、モデルではなくベンチマーク自体を測っているためだと分かった。専門家が誤った模範解答を修正し、欠陥のある設問を修復または除外したところ、GPT-5.6-SolのHLE-Physicsにおけるmean@4は47.3%から78.7%へ上昇した。
要点
- HLE-PhysicsでのGPT-5.6-Solのmean@4は、専門家による再採点後に47.3%から78.7%へ上昇し、CMT-Benchmarkでは61.0%から87.2%へ伸びた。
- 専門家のレビューを通過したCritPtの54問では、補正後のpass@4が94.4%に達した。著者らはこれをほぼ飽和状態と表現している。
- 論文は、低い物理スコアがArtificial Analysis Intelligence Index(2026)を通じて広めた印象に真っ向から反論する。監査された誤りの大半は推論の失敗ではなく採点上の産物だったとする。
監査チームが実際に行ったこと
この研究はarXiv:2609.13009として公開された。出発点は、著者らが繰り返し目にしてきた食い違いである。公開されたベンチマークの結果は、フロンティアモデルが高度な物理でいまだ苦戦していると示していた。一方、同じモデルを研究に使う物理学者たちの実感は違っていた。
チームは逸話に頼らず、フロンティアモデルを6種のベンチマークで走らせ、その結果を各分野の専門家に委ねた。該当する専門分野を持つ教員と大学院研究者が、設問文と模範解答、モデルの応答を一つずつ読み込んだ。対象はテキストのみで構成され、最終解答を検証できる問題に限定した。
彼らの役割は、誤答を四つに分類することだった。真のモデルの誤り、採点の誤り、誤った模範解答、そして答えを正当化できないほど曖昧または条件不足の設問である。中心となる結論は、当初不正解と採点された事例の大半が後ろの三つに該当したという点だ。
補正後のスコアがこれほど動いた理由
専門家が誤った模範解答を修正し、壊れた設問を手直しまたは除外すると、スコアは全体的に大きく上昇した。最も大きい二つの伸びはGPT-5.6-Solのものだ。HLE-Physicsが47.3%から78.7%へ、CMT-Benchmarkが61.0%から87.2%へ動いた。いずれもmean@4での測定値である。
CritPtでは、レビュー後に残った54問に対する補正後のpass@4が94.4%に達した。著者らは、UGPhysicsとPRISM-Physics、PHYBenchの監査対象部分集合でもスコアが大幅に上がったと報告している。ただし補正後のスコアは残された部分集合のみで算出した値だ。元の全問題集合ではなく、専門家の精査を通過した問題での性能を示している。
この結果が突きつける測定の問題
今回の結果は、公開されている大規模言語モデルのリーダーボードが何を測っているのかという、現在進行形の論争のただ中に落ちた。ベンチマークの正解が誤っていれば、正しく推論したモデルが減点され、その上に積み上げられた総合指数は誤りをそのまま読者に伝える。
この失敗の型は物理に限らない。評価を支える足場こそがスコアを動かす変数だと、これまで繰り返し示されてきた。NvidiaのAVOハーネスは、モデルを一切変えずにClaude Opus 5のARC-AGI-3を30%から満点へ引き上げた。今回精査の対象となった足場は、採点そのものである。
飽和の先に残るもの
著者らは補正後の数値を、モデルの能力全般に対する免罪符として提示してはいない。結論はより狭く、より鋭い。現在のベンチマークは、よく定義された閉じた形式の物理問題においてフロンティアモデルの実力を大幅に過小評価しており、そうした問題は評価の信号源としてほぼ尽きているというものだ。
ここから先に必要なのは、より難しく専門家が検証した評価である。検証可能な最終解答が存在しない自由形式の研究課題、数値を突き合わせるのではなく専門家が推論の筋道を判断しなければならない課題だ。こうした評価の構築は、問題集を集めてくるよりはるかに高くつく。欠陥のあるベンチマークが流通し続けた理由の一端もそこにある。
よくある質問
監査された物理ベンチマークはどれですか
HLE-PhysicsとCMT-Benchmark、CritPt、UGPhysics、PRISM-Physics、PHYBenchの6種です。監査はテキストのみで最終解答を検証できる問題を対象とし、補正後のスコアは専門家のレビュー後に残った部分集合で算出されました。
フロンティアモデルが物理を解決したということですか
いいえ。論文の主張は、検証可能な解答を持つ閉じた形式の物理問題でモデルが飽和に近いという点であり、それは物理の仕事のごく狭い一部です。著者らは問題が解決したと宣言せず、より厳しい専門家検証型の評価が必要だと明言しています。
元のベンチマークのスコアが誤りなら、なぜそれが問題になるのですか
総合指数がその数値をそのまま引き継ぐからです。Artificial Analysis Intelligence Index(2026)に載った低い物理スコアは、モデルの推論能力に対する世間の見方を形づくりました。土台となる採点が誤っていたなら、その見方も誤っていたことになります。






