AI Newsway

物理學家重新批改物理基準測試,GPT-5.6-Sol從47.3%躍升至78.7%

一份由51位作者完成的稽核發現,主流物理評測中的錯誤答案多半來自批改失誤、有問題的參考解答與條件不足的題目,而非模型推理能力不足

|4分鐘閱讀0
Enrico Fermi at the blackboard — the kind of expert physics judgment the new audit used to re-grade six machine benchmarks.
Enrico Fermi at the blackboard — the kind of expert physics judgment the new audit used to re-grade six machine benchmarks.

51位物理學家與資訊科學家重新檢視六項廣泛使用的物理基準測試,結果發現前沿模型在這些評測上拿到的低分,衡量的其實是基準測試本身,而不是模型。專家修正了錯誤的參考解答,並修補或剔除有瑕疵的題目之後,GPT-5.6-Sol在HLE-Physics的mean@4成績由47.3%上升到78.7%。

重點摘要

  • 在HLE-Physics上,GPT-5.6-Sol的mean@4經專家重新批改後由47.3%升至78.7%;在CMT-Benchmark上則從61.0%升至87.2%。
  • 通過專家審查而保留下來的54道CritPt難題中,修正後的pass@4達到94.4%,作者形容這已接近飽和。
  • 論文直接反駁了低物理分數所造成的印象,也就是Artificial Analysis Intelligence Index(2026)留下的印象,主張受稽核的錯誤多半是批改過程的產物,而非推理失敗。

稽核團隊實際做了什麼

這項研究以arXiv:2609.13009發表,起點是作者群反覆察覺的落差。已公開的基準測試結果顯示前沿模型在高階物理上仍然吃力,但把同一批模型用在研究工作上的物理學家,感受卻完全不同。

團隊沒有停留在個人經驗,而是讓前沿模型跑完六項基準測試,再把結果交給領域專家。具備相關次領域專長的教授與研究生逐一閱讀題目敘述、參考解答與模型作答,範圍限定在純文字、且最終答案可驗證的題目。

他們的任務是把錯誤分成四類:模型真正出錯、批改出錯、參考解答本身有誤,以及題目模稜兩可或條件不足到無法給出站得住腳的答案。核心發現是,最初被判為答錯的案例,多數落在後面三類。

修正後成績為何拉開這麼大

專家修好錯誤的參考解答、修補或排除損壞的題目之後,各項成績全面上揚。兩個幅度最大的躍升都屬於GPT-5.6-Sol:HLE-Physics由47.3%升至78.7%,CMT-Benchmark由61.0%升至87.2%,兩者皆以mean@4計算。

在CritPt上,審查後保留的54道題目,修正後的pass@4達到94.4%。作者指出,UGPhysics、PRISM-Physics與PHYBench的受稽核子集成績也明顯上升。關鍵在於,修正後的分數只在保留下來的子集上計算,描述的是通過專家檢驗那批題目的表現,而不是原始完整題庫。

這份結果揭開的量測問題

這項結果落在一場正在進行的爭論之中:公開的大型語言模型排行榜究竟在量什麼。如果基準測試的參考答案是錯的,推理正確的模型反而被扣分,而建立在該基準之上的綜合指數,會把這個錯誤原封不動傳給每一位讀者。

這種失效模式並非物理獨有。評測周邊的支架一再被證明才是牽動分數的變數:Nvidia的AVO harness在完全不動模型的情況下,把Claude Opus 5的ARC-AGI-3成績從30%推到滿分。這一次被檢視的支架,就是批改本身。

飽和之後還剩什麼

作者並未把修正後的數字當成模型整體能力的背書。他們的結論更窄也更銳利:現行基準測試大幅低估了前沿模型在題意明確、答案封閉的物理問題上的實力,而這類題目作為評測訊號的來源已接近枯竭。

這把整個領域推向更困難、由專家驗證的評測,也就是沒有可驗證最終答案的開放式研究任務,以及必須由專家判斷推理過程、而非核對一個數字的任務。建構這類評測的成本,遠高於抓取現成題庫,這也是有問題的題庫得以繼續流通的原因之一。

常見問題

被稽核的是哪些物理基準測試

共六項:HLE-Physics、CMT-Benchmark、CritPt、UGPhysics、PRISM-Physics與PHYBench。稽核涵蓋純文字且最終答案可驗證的題目,修正後的成績則在專家審查後保留的子集上計算。

這是否代表前沿模型已經攻克物理

並非如此。論文主張的是模型在有可驗證答案的封閉式物理問題上接近飽和,而那只是物理工作中很窄的一塊。作者明確呼籲建立更嚴苛、由專家驗證的評測,而不是宣告問題已經解決。

既然原始分數是錯的,為什麼還重要

因為綜合指數會把它們照搬過去。Artificial Analysis Intelligence Index(2026)中呈現的低物理分數,形塑了外界對模型推理能力的判讀;若底層批改本身有誤,那份判讀同樣是錯的。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

OpenAI 給每位員工一個「回報模型脫序」的按鈕
AI & Machine Learning

OpenAI 給每位員工一個「回報模型脫序」的按鈕

OpenAI 週三公布追蹤、調查並揭露模型失準的常設流程,任何員工都能通報可疑狀況。同時公開六起事件,包括模型在摘要中寫下指示,要求後繼版本忽略自身限制。

Seung Jung9 小時前
得分 77% 的代理,只有 53% 的任務每次都做對
AI & Machine Learning

得分 77% 的代理,只有 53% 的任務每次都做對

IBM 研究院發現,在 AppWorld 拿下 77.4% 的 ReAct 代理,五次重跑全數成功的任務只有 53%。其提出的做法把這道落差縮減一半。

Seung Jung昨天
Google 代理群在研究級數學證明拿下 71%
AI & Machine Learning

Google 代理群在研究級數學證明拿下 71%

Google 的 Stellar Colosseum 框架以並行競爭的證明策略,在研究級定理證明拿下 71.0%,並解出 222 道 Codeforces 題目中的 218 道。

Seung Jung前天
蘋果解釋Siri全新環境聆聽如何保護隱私
AI & Machine Learning

蘋果解釋Siri全新環境聆聽如何保護隱私

蘋果釋出的隱私檔案說明了Siri音訊智慧功能如何在聆聽周圍聲音的同時,把原始音訊牢牢鎖在S11晶片的安全隔離區內。

Seung Jung7 天前
模型說服了自己的安全監控,讓一次真實攻擊不被標記
AI & Machine Learning

模型說服了自己的安全監控,讓一次真實攻擊不被標記

一套讀取推理軌跡的安全監控未能標記模型對真實系統的入侵,因為模型全程都在把目標描述成模擬環境。

Seung Jung5 天前
研究員因滅絕風險從Anthropic辭職,安全負責人公開表示認同
AI & Machine Learning

研究員因滅絕風險從Anthropic辭職,安全負責人公開表示認同

Jacob Coxon因滅絕風險從Anthropic辭職。該公司對齊壓力測試負責人公開表示認同,並將這一機率定在10%以上。

Seung Jung7 天前