AWS 的 Strands Agents 團隊在 9 月 21 日釋出了 Strands Harness,採 Apache 2.0 授權,支援 Python 與 TypeScript,可在筆電上執行,也能部署到五家雲端平台的任何一家。真正值得注意的不是基準測試圖表宣稱了什麼,而是 AWS 留在圖上沒有拿掉的那一項:DeepSeek Harness,唯一一個比自家框架用掉更少 token 的對手。
重點摘要
- Strands Harness 是給 Python 與 TypeScript 用的 Apache 2.0 程式庫,呼叫一次
create_harness()即可建立,並可接往 Bedrock、Anthropic、OpenAI、Google、LiteLLM 或本機的 Ollama 模型。 - AWS 把成果歸功於三項脈絡管理預設值:超過約 1,500 個 token 的工具輸出會被截斷、脈絡用量達 85% 時啟動壓縮、視窗溢位時在迴圈內復原。
- DeepSeek Harness 比 AWS 的迴圈少用約 14% 的 token,但在每一項評測上的分數都更低。這正是 AWS 的平均節省幅度落在 28% 而非 45% 的原因。
同一份發表為何出現兩個節省數字
所謂框架,指的是包在模型外面的一切:迴圈、工具定義、脈絡處理、記憶,以及執行出錯時的復原機制。這些都不是模型本身,卻全都決定了帳單金額。AWS 把自家框架拿來對上 Claude Code、Codex、oh-my-pi、OpenCode 與 DeepSeek Harness,透過 Terminal-Bench 作者群打造的 Harbor 框架,在 EC2 上跑完六項評測後取平均。
若只看開發者實際拿來做原型的那兩個代理,節省幅度就是 The New Stack 拿來下標的 45%。把 DeepSeek 的框架納入比較範圍,平均就掉到 28%,因為那一項比 AWS 做出來的任何東西都便宜。選擇公開它而不是把圖表修掉,這一點值得記上一筆,也讓更誠實的解讀得以成立:這場比較裡最便宜的框架,同時也是最不準確的那一個。
只留下一個變數的比較
同時更換模型與框架的基準表格,無法把結果歸因給任何一方。Terminal-Bench 2.1 這一輪把模型固定為 Claude Fable 5,各跑 89 次試驗,差異這才具有意義。對上 Claude Code,AWS 的迴圈成本低 77%、準確度高 7.9 個百分點;對上 oh-my-pi,則以低得多的花費達到同樣的 69.7 準確度。DeepSeek 的版本省下更多錢,代價是讓出 10.2 個百分點。
對於全天候跑代理的團隊來說,平均 28% 不是可以四捨五入掉的差距。若某項工作負載每月 token 帳單達到五位數,光是這一條就足以支撐遷移決定,完全不必搬出準確度的論點。
三項預設值,而且可供查核
AWS 把節省與準確度的功勞多半歸給框架處理脈絡視窗的方式,而不是迴圈本身有什麼巧思。
| 機制 | 觸發條件 |
|---|---|
| 工具輸出截斷 | 結果超過約 1,500 個 token |
| 壓縮(摘要) | 脈絡使用率超過 85% |
| 迴圈內脈絡復原 | 執行途中視窗溢位 |
這些都是再普通不過的工程決策,而這正是重點:收益來自任何團隊都設得出來、卻大多沒去設定的預設值。呼叫一次 create_harness(),回傳的代理就已經帶著 shell、檔案與網路工具、提示詞快取、可依 session ID 續接的記憶,以及一個依檢查清單接手開放式子任務的輔助代理。模型呼叫預設走 Amazon Bedrock,也能改指向 Anthropic、OpenAI、Google、LiteLLM 或本機的 Ollama 模型,MCP 伺服器則可當成外部工具掛入。
獨立研究指向同一個方向
比較 Claude Code、Codex CLI 與 Pi 在七個模型上表現的 HarnessTax 研究發現,框架的選擇幾乎不影響成功率,同一個模型卻可能以最高五倍的成本差距達到相近的結果。對於主打能力來賣框架的廠商,這是個難堪的結論,卻剛好替 AWS 的說法背書:如果準確度大致可以互換,剩下的軸線就只有花費。針對 Strands 基準測試的後續論文也已預告。
這也是 AWS 短時間內第二次釋出開放的代理基礎建設。前一次是一份完全沒有附上分數的基準測試,這次的釋出補上了當時缺席的數字。
後續觀察重點
由於這套框架是程式庫相依套件而非應用程式,在筆電上組出來的代理,理應就是部署到 AWS、Google Cloud、Azure、Cloudflare 或 Modal 的同一份產物。隨附的 CLI 本身也建在這套框架上,能把白話描述轉成可匯出的 Python 或 TypeScript 程式碼。尚待驗證的是,在 AWS 沒有挑選的任務組合上,成本差距是否仍然成立——這也是那篇預告中的後續論文比發表當天的圖表更重要的原因。
FAQ — 常見問題
Strands Harness 可以免費使用嗎?
可以。它以 Apache 2.0 授權提供 Python 與 TypeScript 版本,透過 GitHub 與 PyPI 發布。搭配本機 Ollama 模型可完全離線執行;若使用雲端供應商,模型 API 費用另計。
Strands Harness 只能在 AWS 上跑嗎?
不是。Amazon Bedrock 只是預設的模型路徑,改一行就能換成 Anthropic、OpenAI、Google、LiteLLM 或本機模型。支援的部署目標包含 Google Cloud、Azure、Cloudflare 與 Modal。
它算是像 Claude Code 那樣的編碼代理嗎?
AWS 說它是通用型而非專門用於寫程式,儘管它的基準對手都是編碼代理。它內建 shell、檔案與網路工具,並把開放式子任務交給內建的輔助代理處理。






