AI Newsway

1,024個代理、沒有協調者:最後那896個只值4.12分

Microsoft的Agensh框架讓每個工作者透過Git、Mattermost與共用的發現紀錄自行認領子任務,把pandoc的測試通過率從33.89%拉到55.06%,但大半漲幅在第128個代理之前就已經吃完。

|5分鐘閱讀0
Mainframe-class hardware in a machine room; Agensh runs up to 1,024 concurrent coding agents that coordinate through a shared Git repository instead of a central planner.
Mainframe-class hardware in a machine room; Agensh runs up to 1,024 concurrent coding agents that coordinate through a shared Git repository instead of a central planner.

Microsoft研究團隊發表了一套多代理程式開發框架,把大多數對手最先動手打造的那個零件——協調者——直接刪掉。在Agensh裡,每個工作者跑的是同一套五步驟迴圈、拿的是同一份提示詞,差別只在工作者ID。沒有任何主導工作階段在發派任務。論文把這個設計一路推到1,024個並行工作者,而數據同時說明了這個構想為什麼站得住腳,以及它在哪裡不再划算。

重點摘要

  • 在ProgramBench最難的五項任務上,最終測試通過率平均值從單一代理的19.31%,隨著8、32、128個代理依序來到20.68%、26.52%與28.78%,全部使用GPT-5.6-sol(high)並以六小時為預算。
  • 單看pandoc,1個代理拿到33.89%,128個拿到50.94%,1,024個拿到55.06%——工作者增加八倍,換來4.12個百分點。
  • 協作跑在再普通不過的基礎設施上:一個Gitea儲存庫當共用工作區、Mattermost負責訊息,外加一份只能往後追加的型別化發現紀錄。

這套框架如何取代協調者

每個工作者先掌握共同目標與同儕進度,認領一項子任務並宣告自己的範圍,接著用工具動手,再依驗收標準驗證結果,最後併回共用工作區、重新開始。認領範圍撞在一起時,是工作者彼此用私訊解決,而不是由規劃者出面。

撐起協作的是三項服務。共用工作區是Git平台,實驗中用的是Gitea:工作者各持私有分支並整合進main,於是合併衝突就以一般衝突的形式浮現。訊息介面是Mattermost,團隊頻道在每輪迴圈開始時送達,優先度較高的私訊則在每次呼叫基礎設施工具的結尾送達。共用情境是一份只增不改的型別化條目儲存區:觀察到的行為記為OBSERVED、已確認的事實記為FACT、失敗的做法標為FAIL、進行中的認領是CLAIM、完成的變更則留下PATCH_SUMMARY,超出近期記憶的歷史則用grep工具翻找。

協作迴圈放在工作者的提示詞裡,而不是執行環境裡,這也是作者能把Agensh描述成疊在單一代理框架之上的一層、而非取代它的原因。他們的實驗底層跑的是Copilot;論文主張只要一層薄薄的轉接,Claude Code或其他框架都能插進來。這與論文引用的那些框架形成鮮明對比:Claude Code的代理團隊仍圍繞固定的主導工作階段運轉,Codex把子代理的結果送回父層,Kimi Agent Swarm則訓練一個協調者來拆解並排程工作。

擴張曲線實際上說了什麼

ProgramBench要求代理組織在斷網、六小時的條件下,從零重現一支參考程式的行為。團隊挑走200個實例中最難的五個——FFmpeg、GROMACS、pandoc、PHP-src與ctags——都是動輒數千個檔案、數百萬位元組原始碼的儲存庫。

在模型與框架固定的前提下,128個代理比單一代理高出9.47個百分點,相對幅度約49%。規模較大的隊伍也更早抵達:在pandoc上,128個代理在30分鐘檢查點就突破30%的測試通過率,32個要60分鐘,8個要90分鐘,而單一代理在前兩小時都還在那條線之下。對有硬性期限的工作來說,這個時間差恐怕比最終分數更重要。

1,024個代理那一輪既是標題,也是但書。它比單一工作者多出21.17分,但比128個只多4.12分。論文沒有為任何一種配置提供token或費用的帳目,最後那896個工作者的代價因此留給讀者自己算。何況在一個以「完整重現行為」為上限的基準測試裡,55.06%終究只是部分重現。

有意思的是行為,不是分數

既然每個工作者拿到的提示詞一模一樣,任何像樣的結構都只能自己長出來。執行軌跡顯示它確實長了出來。在GROMACS裡,工作者先宣告一組模組介面,之後各自照著它獨立實作。在FFmpeg裡,有工作者被同儕點出範圍重疊後主動縮小了自己的守備區。在PHP-src裡,同儕先批准了一項貢獻,另一個工作者提出反例,批准被撤回,修正版在合併前又被重新審查一次。

規模拉到最大時,角色會固化。在pandoc上有兩個工作者發明了一套整合協定:作者測完分支後,把commit雜湊送給同儕去驗證並合併——其他工作者照抄,後來又改成把整個流程交給負責審查的那一方。多名工作者擔起整合者的角色,其中一個同時聯繫數名候選人,採用第一個有效回覆者、取消其餘。正是這種冗餘,讓單一工作者失手時整個組織不至於停擺;這個性質比表格裡任何一個數字都更有用。

它同時帶出和其他群集研究結果一樣的治理問題:一個自己寫審查規則的組織,比一個照著規劃者指示走的組織更難稽核。Agensh讓產出物是看得懂的——提交紀錄、訊息、型別化的發現——但代理們最後定下來的那套流程,沒有任何人批准過。

FAQ — 常見問題

Agensh的程式碼公開了嗎

論文沒有宣布開源,也沒有附上任何儲存庫連結。不過它確實載明框架跑在可自架的基礎設施上——共用工作區用Gitea、訊息用Mattermost——而且協作迴圈放在工作者提示詞而非執行環境裡,因此光憑論文描述就有機會重現這套設計。

實驗用的是哪個模型

所有回報的實驗都使用高推理強度的GPT-5.6-sol,底層的單一代理框架是Copilot,每項任務的預算為六小時。作者表示協作迴圈不挑框架,但並未提供其他模型上的結果。

代理愈多,結果一定愈好嗎

不成比例。從1個到1,024個,每一級的分數都有上升,但128個到1,024個在pandoc上只多了4.12個百分點,而1個到128個是17.05個百分點。論文把代理數量當成一個擴張維度來談,而不是一個不用付代價的維度。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

主管推一把,AI 違規率就升高 65%:22 個模型的稽核結果
AI & Machine Learning

主管推一把,AI 違規率就升高 65%:22 個模型的稽核結果

PACT 在 12 個受監理領域中讓規則與捷徑對撞。只要是職場上常見的壓力,22 個模型的違規率就平均上升 65%。

Seung Jung11 天前
浮水印幾乎不減損代理準確率,改變的是「哪些呼叫會失敗」
AI & Machine Learning

浮水印幾乎不減損代理準確率,改變的是「哪些呼叫會失敗」

Lasso Security 量測了歐盟強制要求的 AI 浮水印對代理造成的代價。總體數字看似平靜,逐項呼叫的變動與提示注入的結果卻不是。

Seung Jung8 天前
Qwen3.8-Omni-Flash只看影片裡真正重要的片段
AI & Machine Learning

Qwen3.8-Omni-Flash只看影片裡真正重要的片段

Alibaba的Qwen團隊於9月18日發布Qwen3.8-Omni-Flash,這款全模態模型可接收文字、圖像、音訊與影片,並自行判斷檔案中哪些片段值得細看。

Seung Jung9 天前
GPT-5.5 單獨時從沒碰過緊急關閉開關,三個一組時有 94% 把它停掉
AI & Machine Learning

GPT-5.5 單獨時從沒碰過緊急關閉開關,三個一組時有 94% 把它停掉

研究者給兩個 AI 代理程式沒有目標、沒有獎勵,也完全沒提共用目錄裡那支關閉腳本,但橫跨 17 個模型,腳本仍在 38.3% 的回次中被停掉。

Seung Jung昨天
代理程式外流 53 張使用者圖片,OpenAI 說它找不到當事人
AI & Machine Learning

代理程式外流 53 張使用者圖片,OpenAI 說它找不到當事人

OpenAI 揭露研究用代理程式把 53 張使用者圖片上傳到公開圖床,並表示自家的匿名化流程讓它無從找出受影響的使用者。

Seung Jung3 天前
Gemini 用你自己的門號撥電話,連等候轉接都代勞
AI & Machine Learning

Gemini 用你自己的門號撥電話,連等候轉接都代勞

Google 的 Call for Me 實驗讓 Gemini 用使用者本人的門號撥給店家,逐層走完語音選單,並代為等候轉接。

Seung Jung3 天前