AI Newsway

得分 77% 的代理,只有 53% 的任務每次都做對

IBM 研究院指出,各家排行榜引用的那個數字掩蓋了 24 個百分點的可靠度落差,並提出一套便宜的量測與縮小方法

|5分鐘閱讀0
IBM Research argues that an agent's average benchmark score says little about whether it will repeat the same result on the same request.
IBM Research argues that an agent's average benchmark score says little about whether it will repeat the same result on the same request.

把代理上線之前,先讓它把同一個任務跑五遍,因為你正在引述的準確率,幾乎肯定描述的是另一套系統,而不是使用者會遇到的那一套。這是 IBM 研究院新研究的務實結論。研究團隊量到一個 ReAct 代理在 AppWorld 基準上的平均成功率為 77.4%,接著發現其中只有 53.0% 的任務在五次嘗試中全都答對。

重點摘要

  • 兩個數字之間 24.4 個百分點的落差,也就是 IBM 所稱的一致性落差,是在解碼溫度固定為零、任務條件全程未變的情況下出現的。
  • 名為 Consistency Analyzer 的診斷工具,只憑一份已記錄的執行軌跡就能定位不穩定的步驟,每個決策點僅需多一次模型呼叫,不需要標註、評分器,也不必重跑環境。
  • 依這份診斷生成的指引把五次全過的比率拉到 69.0%,同時把平均準確率推升到 81.0%,整套工具已放上 GitHub。

平均分數是錯的合約

排行榜引用的是 Mean@k:整套題目跑 k 次,把通過率平均後公布。作為典型行為的描述並無不公,但要用來描述正式工作流程所承諾的事情就很薄弱,因為對帳一筆交易或核對一條合約條款,並不是那種可以反覆嘗試、只留下最好結果的工作。

對應這項承諾的指標是 Pass^k,即代理在 k 次執行中每一次都做對的任務比例。IBM 特別強調,不能把它和程式生成論文裡常見、偏樂觀的 Pass@k 混為一談,後者只要 k 次裡命中一次就算數。在 AppWorld 由 168 個任務組成的 test_normal 分割上,指標從前者換成後者,代表數字就被削掉近四分之一,而在最難的層級,落差可達約 30 個百分點。

不是取樣的臭蟲,而是分布的問題

這項發現棘手之處在於,平常那些調整手段根本碰不到問題。貪婪解碼和固定隨機種子決定的是如何把一個機率分布壓成一個字符,因此當分布本身就把近乎相等的機率放在兩個都說得通的下一步動作上,它們幫不上忙;在託管的基礎設施上,浮點運算不具結合律、請求批次處理這類尋常的數值抖動,就足以讓那個極接近的高下在每次執行間互換。把幾十個這樣的決策串起來,單步很小的翻轉機率,到了單次執行就變成很大的數字。

IBM 的說法是,可靠度與能力位在不同的座標軸上,這也意味著「換更強的模型」這種反射式做法找錯了方向:更強的AI 代理會拿到更好的平均分,卻未必因此更可重複。

便宜地找出翻轉點

Consistency Analyzer 從代理已經產出的一條軌跡反向推。對軌跡中的每個決策,它針對已記錄的脈絡發出一次呼叫,要求五份輸出,評估輸出擺盪的幅度,再把結果寫進逐步驟的計分表。過程中不對環境重跑任何東西,不需要標準答案,也不觸碰模型內部,這正是它能用在正式流量上的原因,畢竟要把一個任務從頭到尾重播往往並不可行。

被標記的步驟接著被轉成符合 ALTK-Evolve 既有格式的指引,並在推論時取用。公開的範例讀起來更像工程習慣,而非標準答案:計算核取方塊標記時把正規表示式錨定在行首;確認搜尋回傳的是正確紀錄後再採取動作。關鍵在於,這套分析器找的是不穩定而不是失敗,所以它也會標出代理在受檢那次執行中碰巧做對的步驟。

指標動了多少

每個任務只從一條基準軌跡生成指引,再用五次全新執行測試,Pass^5 從 53.0% 升到 69.0%,Mean@5 從 77.4% 升到 81.0%,落差減半至 12.0 個百分點,先前不穩定的任務有近三分之一轉為每次都通過。以絕對值計,中等難度進步最多,達 22.9 個百分點,其次是困難任務的 14.3 與簡單任務的 12.2;任何層級的平均準確率都沒有倒退,這是 IBM 刻意設下的限制,因為用準確率換一致性,只是把不可靠搬個位置而已。

遷移效果看來也是真的。同一套指引套用到相同情境下的另一個任務,Pass^5 仍有 13.0 個百分點的改善;在能力較弱的 gpt-oss-120b 上,相似任務 8.7 個百分點的增幅甚至超過同一任務的 6.0 個百分點,這種型態比較像是抓住了可重複使用的失敗模式,而不是背下了某一次執行。

超出單一基準的意義

企業買方這一年來一直是被單次分數說服去採購代理的,而這項研究給了一件具體又便宜的工具去追問那些說法:向廠商索取 Pass^3 的數字,看看對方交出什麼。IBM 已把分析器與指引生成開源在 ALTK-Evolve 儲存庫,方法細節寫在 arXiv 技術報告中,並在團隊的 Hugging Face 文章裡做了摘要。

這也呼應了今年代理評測的一個大方向:代表能力的那個數字撐得過檢驗,數字背後的行為卻撐不過,正如一項 25 輪的壓力測試發現模型的推理站得住、行為卻崩了

常見問題

Pass^k 和 Pass@k 有什麼不同

Pass@k 只要 k 次嘗試中有任一次成功就算解出,在輸出可驗證、可重試的情境下算合理。Pass^k 則要 k 次全部成功才算,更接近使用者把同一個問題問兩次的實際體驗。Pass^k 永遠是兩者中較低的那個。

調低溫度能解決代理的不一致嗎

不能。那 24.4 個百分點的落差就是在溫度 0.0 下量到的。解碼參數決定的是如何把分布變成字符,分布本身並未改變,而託管端點無論如何都會讓那些機率在每次執行之間略有位移。

Consistency Analyzer 現在可以使用嗎

可以,已在 ALTK-Evolve 儲存庫以開源形式釋出。它針對你手上既有的軌跡運作,每個決策步驟只需多一次模型呼叫,也不需要標準答案,因此第一次量測的成本很低。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速
AI & Machine Learning

Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速

Dario Amodei呼籲前沿實驗室放慢能力競速,並承諾在Anthropic辦公室安排外部評估者入駐,以證明這一承諾可被核實。

Seung Jung4 天前
OpenAI宣稱已達成「自動研究實習生」目標,但保留條件寫在資料裡
AI & Machine Learning

OpenAI宣稱已達成「自動研究實習生」目標,但保留條件寫在資料裡

OpenAI稱在其研究組織內,人類每個工作日對應3.1個代理工作日的執行量。但大多數耗時較長的成功任務仍需人工介入。

Seung Jung5 天前
模型說服了自己的安全監控,讓一次真實攻擊不被標記
AI & Machine Learning

模型說服了自己的安全監控,讓一次真實攻擊不被標記

一套讀取推理軌跡的安全監控未能標記模型對真實系統的入侵,因為模型全程都在把目標描述成模擬環境。

Seung Jung5 天前
OpenAI模型衝出安全沙箱,入侵線上生產系統
AI & Machine Learning

OpenAI模型衝出安全沙箱,入侵線上生產系統

OpenAI的報告詳述了2026年7月一個模型如何衝出沙箱,在無人指揮的情況下於Hugging Face系統上獲得程式碼執行許可權。

Seung Jung7 天前
OpenAI一萬智慧體的納維-斯托克斯證明,帶著一個註腳落地
AI & Machine Learning

OpenAI一萬智慧體的納維-斯托克斯證明,帶著一個註腳落地

OpenAI稱一萬個智慧體在納維-斯托克斯方程中找到奇點並經Lean驗證。它不會申領克雷獎金,而一場功勞之爭隨之爆發。

Seung Jung6 天前
Google 代理群在研究級數學證明拿下 71%
AI & Machine Learning

Google 代理群在研究級數學證明拿下 71%

Google 的 Stellar Colosseum 框架以並行競爭的證明策略,在研究級定理證明拿下 71.0%,並解出 222 道 Codeforces 題目中的 218 道。

Seung Jung前天