Microsoft研究團隊發表了一套多代理程式開發框架,把大多數對手最先動手打造的那個零件——協調者——直接刪掉。在Agensh裡,每個工作者跑的是同一套五步驟迴圈、拿的是同一份提示詞,差別只在工作者ID。沒有任何主導工作階段在發派任務。論文把這個設計一路推到1,024個並行工作者,而數據同時說明了這個構想為什麼站得住腳,以及它在哪裡不再划算。
重點摘要
- 在ProgramBench最難的五項任務上,最終測試通過率平均值從單一代理的19.31%,隨著8、32、128個代理依序來到20.68%、26.52%與28.78%,全部使用GPT-5.6-sol(high)並以六小時為預算。
- 單看pandoc,1個代理拿到33.89%,128個拿到50.94%,1,024個拿到55.06%——工作者增加八倍,換來4.12個百分點。
- 協作跑在再普通不過的基礎設施上:一個Gitea儲存庫當共用工作區、Mattermost負責訊息,外加一份只能往後追加的型別化發現紀錄。
這套框架如何取代協調者
每個工作者先掌握共同目標與同儕進度,認領一項子任務並宣告自己的範圍,接著用工具動手,再依驗收標準驗證結果,最後併回共用工作區、重新開始。認領範圍撞在一起時,是工作者彼此用私訊解決,而不是由規劃者出面。
撐起協作的是三項服務。共用工作區是Git平台,實驗中用的是Gitea:工作者各持私有分支並整合進main,於是合併衝突就以一般衝突的形式浮現。訊息介面是Mattermost,團隊頻道在每輪迴圈開始時送達,優先度較高的私訊則在每次呼叫基礎設施工具的結尾送達。共用情境是一份只增不改的型別化條目儲存區:觀察到的行為記為OBSERVED、已確認的事實記為FACT、失敗的做法標為FAIL、進行中的認領是CLAIM、完成的變更則留下PATCH_SUMMARY,超出近期記憶的歷史則用grep工具翻找。
協作迴圈放在工作者的提示詞裡,而不是執行環境裡,這也是作者能把Agensh描述成疊在單一代理框架之上的一層、而非取代它的原因。他們的實驗底層跑的是Copilot;論文主張只要一層薄薄的轉接,Claude Code或其他框架都能插進來。這與論文引用的那些框架形成鮮明對比:Claude Code的代理團隊仍圍繞固定的主導工作階段運轉,Codex把子代理的結果送回父層,Kimi Agent Swarm則訓練一個協調者來拆解並排程工作。
擴張曲線實際上說了什麼
ProgramBench要求代理組織在斷網、六小時的條件下,從零重現一支參考程式的行為。團隊挑走200個實例中最難的五個——FFmpeg、GROMACS、pandoc、PHP-src與ctags——都是動輒數千個檔案、數百萬位元組原始碼的儲存庫。
在模型與框架固定的前提下,128個代理比單一代理高出9.47個百分點,相對幅度約49%。規模較大的隊伍也更早抵達:在pandoc上,128個代理在30分鐘檢查點就突破30%的測試通過率,32個要60分鐘,8個要90分鐘,而單一代理在前兩小時都還在那條線之下。對有硬性期限的工作來說,這個時間差恐怕比最終分數更重要。
1,024個代理那一輪既是標題,也是但書。它比單一工作者多出21.17分,但比128個只多4.12分。論文沒有為任何一種配置提供token或費用的帳目,最後那896個工作者的代價因此留給讀者自己算。何況在一個以「完整重現行為」為上限的基準測試裡,55.06%終究只是部分重現。
有意思的是行為,不是分數
既然每個工作者拿到的提示詞一模一樣,任何像樣的結構都只能自己長出來。執行軌跡顯示它確實長了出來。在GROMACS裡,工作者先宣告一組模組介面,之後各自照著它獨立實作。在FFmpeg裡,有工作者被同儕點出範圍重疊後主動縮小了自己的守備區。在PHP-src裡,同儕先批准了一項貢獻,另一個工作者提出反例,批准被撤回,修正版在合併前又被重新審查一次。
規模拉到最大時,角色會固化。在pandoc上有兩個工作者發明了一套整合協定:作者測完分支後,把commit雜湊送給同儕去驗證並合併——其他工作者照抄,後來又改成把整個流程交給負責審查的那一方。多名工作者擔起整合者的角色,其中一個同時聯繫數名候選人,採用第一個有效回覆者、取消其餘。正是這種冗餘,讓單一工作者失手時整個組織不至於停擺;這個性質比表格裡任何一個數字都更有用。
它同時帶出和其他群集研究結果一樣的治理問題:一個自己寫審查規則的組織,比一個照著規劃者指示走的組織更難稽核。Agensh讓產出物是看得懂的——提交紀錄、訊息、型別化的發現——但代理們最後定下來的那套流程,沒有任何人批准過。
FAQ — 常見問題
Agensh的程式碼公開了嗎
論文沒有宣布開源,也沒有附上任何儲存庫連結。不過它確實載明框架跑在可自架的基礎設施上——共用工作區用Gitea、訊息用Mattermost——而且協作迴圈放在工作者提示詞而非執行環境裡,因此光憑論文描述就有機會重現這套設計。
實驗用的是哪個模型
所有回報的實驗都使用高推理強度的GPT-5.6-sol,底層的單一代理框架是Copilot,每項任務的預算為六小時。作者表示協作迴圈不挑框架,但並未提供其他模型上的結果。
代理愈多,結果一定愈好嗎
不成比例。從1個到1,024個,每一級的分數都有上升,但128個到1,024個在pandoc上只多了4.12個百分點,而1個到128個是17.05個百分點。論文把代理數量當成一個擴張維度來談,而不是一個不用付代價的維度。






