AI Newsway

AWS 開源代理框架 Strands Harness,連比自己更省錢的對手也一併列出

這次以 Apache 2.0 釋出的版本附帶脈絡管理預設值,而基準測試圖表中留著一個在 token 花費上贏過 AWS 的競爭者

|5分鐘閱讀0
Server racks in a data centre — Strands Harness is built so the agent prototyped on a laptop is the same artifact deployed to cloud infrastructure
Server racks in a data centre — Strands Harness is built so the agent prototyped on a laptop is the same artifact deployed to cloud infrastructure

AWS 的 Strands Agents 團隊在 9 月 21 日釋出了 Strands Harness,採 Apache 2.0 授權,支援 Python 與 TypeScript,可在筆電上執行,也能部署到五家雲端平台的任何一家。真正值得注意的不是基準測試圖表宣稱了什麼,而是 AWS 留在圖上沒有拿掉的那一項:DeepSeek Harness,唯一一個比自家框架用掉更少 token 的對手。

重點摘要

  • Strands Harness 是給 Python 與 TypeScript 用的 Apache 2.0 程式庫,呼叫一次 create_harness() 即可建立,並可接往 Bedrock、Anthropic、OpenAI、Google、LiteLLM 或本機的 Ollama 模型。
  • AWS 把成果歸功於三項脈絡管理預設值:超過約 1,500 個 token 的工具輸出會被截斷、脈絡用量達 85% 時啟動壓縮、視窗溢位時在迴圈內復原。
  • DeepSeek Harness 比 AWS 的迴圈少用約 14% 的 token,但在每一項評測上的分數都更低。這正是 AWS 的平均節省幅度落在 28% 而非 45% 的原因。

同一份發表為何出現兩個節省數字

所謂框架,指的是包在模型外面的一切:迴圈、工具定義、脈絡處理、記憶,以及執行出錯時的復原機制。這些都不是模型本身,卻全都決定了帳單金額。AWS 把自家框架拿來對上 Claude Code、Codex、oh-my-pi、OpenCode 與 DeepSeek Harness,透過 Terminal-Bench 作者群打造的 Harbor 框架,在 EC2 上跑完六項評測後取平均。

若只看開發者實際拿來做原型的那兩個代理,節省幅度就是 The New Stack 拿來下標的 45%。把 DeepSeek 的框架納入比較範圍,平均就掉到 28%,因為那一項比 AWS 做出來的任何東西都便宜。選擇公開它而不是把圖表修掉,這一點值得記上一筆,也讓更誠實的解讀得以成立:這場比較裡最便宜的框架,同時也是最不準確的那一個。

只留下一個變數的比較

同時更換模型與框架的基準表格,無法把結果歸因給任何一方。Terminal-Bench 2.1 這一輪把模型固定為 Claude Fable 5,各跑 89 次試驗,差異這才具有意義。對上 Claude Code,AWS 的迴圈成本低 77%、準確度高 7.9 個百分點;對上 oh-my-pi,則以低得多的花費達到同樣的 69.7 準確度。DeepSeek 的版本省下更多錢,代價是讓出 10.2 個百分點。

對於全天候跑代理的團隊來說,平均 28% 不是可以四捨五入掉的差距。若某項工作負載每月 token 帳單達到五位數,光是這一條就足以支撐遷移決定,完全不必搬出準確度的論點。

三項預設值,而且可供查核

AWS 把節省與準確度的功勞多半歸給框架處理脈絡視窗的方式,而不是迴圈本身有什麼巧思。

機制觸發條件
工具輸出截斷結果超過約 1,500 個 token
壓縮(摘要)脈絡使用率超過 85%
迴圈內脈絡復原執行途中視窗溢位

這些都是再普通不過的工程決策,而這正是重點:收益來自任何團隊都設得出來、卻大多沒去設定的預設值。呼叫一次 create_harness(),回傳的代理就已經帶著 shell、檔案與網路工具、提示詞快取、可依 session ID 續接的記憶,以及一個依檢查清單接手開放式子任務的輔助代理。模型呼叫預設走 Amazon Bedrock,也能改指向 Anthropic、OpenAI、Google、LiteLLM 或本機的 Ollama 模型,MCP 伺服器則可當成外部工具掛入。

獨立研究指向同一個方向

比較 Claude Code、Codex CLI 與 Pi 在七個模型上表現的 HarnessTax 研究發現,框架的選擇幾乎不影響成功率,同一個模型卻可能以最高五倍的成本差距達到相近的結果。對於主打能力來賣框架的廠商,這是個難堪的結論,卻剛好替 AWS 的說法背書:如果準確度大致可以互換,剩下的軸線就只有花費。針對 Strands 基準測試的後續論文也已預告。

這也是 AWS 短時間內第二次釋出開放的代理基礎建設。前一次是一份完全沒有附上分數的基準測試,這次的釋出補上了當時缺席的數字。

後續觀察重點

由於這套框架是程式庫相依套件而非應用程式,在筆電上組出來的代理,理應就是部署到 AWS、Google Cloud、Azure、Cloudflare 或 Modal 的同一份產物。隨附的 CLI 本身也建在這套框架上,能把白話描述轉成可匯出的 Python 或 TypeScript 程式碼。尚待驗證的是,在 AWS 沒有挑選的任務組合上,成本差距是否仍然成立——這也是那篇預告中的後續論文比發表當天的圖表更重要的原因。

FAQ — 常見問題

Strands Harness 可以免費使用嗎?

可以。它以 Apache 2.0 授權提供 Python 與 TypeScript 版本,透過 GitHub 與 PyPI 發布。搭配本機 Ollama 模型可完全離線執行;若使用雲端供應商,模型 API 費用另計。

Strands Harness 只能在 AWS 上跑嗎?

不是。Amazon Bedrock 只是預設的模型路徑,改一行就能換成 Anthropic、OpenAI、Google、LiteLLM 或本機模型。支援的部署目標包含 Google Cloud、Azure、Cloudflare 與 Modal。

它算是像 Claude Code 那樣的編碼代理嗎?

AWS 說它是通用型而非專門用於寫程式,儘管它的基準對手都是編碼代理。它內建 shell、檔案與網路工具,並把開放式子任務交給內建的輔助代理處理。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Meta 開源 Astryx:一套可供智慧體直接查詢的 React 設計系統
Developer Tools

Meta 開源 Astryx:一套可供智慧體直接查詢的 React 設計系統

Meta 於 6 月以 MIT 許可證釋出了 Astryx 公測版,這套 React 設計系統已在公司內部單一程式碼庫中打磨了八年。

Seung Jung8 天前
Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者
Developer Tools

Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者

重新設計的 Claude Code Projects 在工作執行緒之上擺了一個協調者,每條執行緒都是跑在自有分支上的完整雲端工作階段,並且共用同一份記憶。

Seung Jung4 天前
「只有幾張GPU」的實驗室宣稱:125B模型塞得進單張24GB顯卡
Developer Tools

「只有幾張GPU」的實驗室宣稱:125B模型塞得進單張24GB顯卡

CMU的Tim Dettmers表示,實驗室的框架能在單張24GB GPU上跑125B模型,在128GB的MacBook上跑550B模型。這是六項成果同步釋出的開源週前一天的預告。

Seung Jung6 小時前
LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍
Developer Tools

LLM修復程式碼時弄壞可用程式碼的次數,是真正修好次數的十倍

一項arXiv研究測得LLM修復迴圈破壞正確程式的比率為0.261,修復缺陷程式的比率僅0.023,並找到了驅動這一行為的內部方向。

Seung Jung9 天前
Vercel 因一年前就修好的錯誤,全平台關閉 AVIF
Developer Tools

Vercel 因一年前就修好的錯誤,全平台關閉 AVIF

Vercel 將回報的 Next.js RCE 追查到 libheif,於 8 月 13 日在全平台停用 AVIF,並在 8 月 25 日前協調完成 sharp、libvips 與 libheif 的修補。

Seung Jung3 天前
AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天
Developer Tools

AI智慧體向RubyGems傾瀉2000多個包,新使用者註冊被關閉四天

一份取證報告還原了5月的GemStuffer行動:AI智慧體推送兩千多個gem,迫使RubyGems凍結新使用者註冊四天。

Seung Jung10 天前