51位物理學家與資訊科學家重新檢視六項廣泛使用的物理基準測試,結果發現前沿模型在這些評測上拿到的低分,衡量的其實是基準測試本身,而不是模型。專家修正了錯誤的參考解答,並修補或剔除有瑕疵的題目之後,GPT-5.6-Sol在HLE-Physics的mean@4成績由47.3%上升到78.7%。
重點摘要
- 在HLE-Physics上,GPT-5.6-Sol的mean@4經專家重新批改後由47.3%升至78.7%;在CMT-Benchmark上則從61.0%升至87.2%。
- 通過專家審查而保留下來的54道CritPt難題中,修正後的pass@4達到94.4%,作者形容這已接近飽和。
- 論文直接反駁了低物理分數所造成的印象,也就是Artificial Analysis Intelligence Index(2026)留下的印象,主張受稽核的錯誤多半是批改過程的產物,而非推理失敗。
稽核團隊實際做了什麼
這項研究以arXiv:2609.13009發表,起點是作者群反覆察覺的落差。已公開的基準測試結果顯示前沿模型在高階物理上仍然吃力,但把同一批模型用在研究工作上的物理學家,感受卻完全不同。
團隊沒有停留在個人經驗,而是讓前沿模型跑完六項基準測試,再把結果交給領域專家。具備相關次領域專長的教授與研究生逐一閱讀題目敘述、參考解答與模型作答,範圍限定在純文字、且最終答案可驗證的題目。
他們的任務是把錯誤分成四類:模型真正出錯、批改出錯、參考解答本身有誤,以及題目模稜兩可或條件不足到無法給出站得住腳的答案。核心發現是,最初被判為答錯的案例,多數落在後面三類。
修正後成績為何拉開這麼大
專家修好錯誤的參考解答、修補或排除損壞的題目之後,各項成績全面上揚。兩個幅度最大的躍升都屬於GPT-5.6-Sol:HLE-Physics由47.3%升至78.7%,CMT-Benchmark由61.0%升至87.2%,兩者皆以mean@4計算。
在CritPt上,審查後保留的54道題目,修正後的pass@4達到94.4%。作者指出,UGPhysics、PRISM-Physics與PHYBench的受稽核子集成績也明顯上升。關鍵在於,修正後的分數只在保留下來的子集上計算,描述的是通過專家檢驗那批題目的表現,而不是原始完整題庫。
這份結果揭開的量測問題
這項結果落在一場正在進行的爭論之中:公開的大型語言模型排行榜究竟在量什麼。如果基準測試的參考答案是錯的,推理正確的模型反而被扣分,而建立在該基準之上的綜合指數,會把這個錯誤原封不動傳給每一位讀者。
這種失效模式並非物理獨有。評測周邊的支架一再被證明才是牽動分數的變數:Nvidia的AVO harness在完全不動模型的情況下,把Claude Opus 5的ARC-AGI-3成績從30%推到滿分。這一次被檢視的支架,就是批改本身。
飽和之後還剩什麼
作者並未把修正後的數字當成模型整體能力的背書。他們的結論更窄也更銳利:現行基準測試大幅低估了前沿模型在題意明確、答案封閉的物理問題上的實力,而這類題目作為評測訊號的來源已接近枯竭。
這把整個領域推向更困難、由專家驗證的評測,也就是沒有可驗證最終答案的開放式研究任務,以及必須由專家判斷推理過程、而非核對一個數字的任務。建構這類評測的成本,遠高於抓取現成題庫,這也是有問題的題庫得以繼續流通的原因之一。
常見問題
被稽核的是哪些物理基準測試
共六項:HLE-Physics、CMT-Benchmark、CritPt、UGPhysics、PRISM-Physics與PHYBench。稽核涵蓋純文字且最終答案可驗證的題目,修正後的成績則在專家審查後保留的子集上計算。
這是否代表前沿模型已經攻克物理
並非如此。論文主張的是模型在有可驗證答案的封閉式物理問題上接近飽和,而那只是物理工作中很窄的一塊。作者明確呼籲建立更嚴苛、由專家驗證的評測,而不是宣告問題已經解決。
既然原始分數是錯的,為什麼還重要
因為綜合指數會把它們照搬過去。Artificial Analysis Intelligence Index(2026)中呈現的低物理分數,形塑了外界對模型推理能力的判讀;若底層批改本身有誤,那份判讀同樣是錯的。






