Anthropic 於當地時間 28 日推出 Claude Sonnet 5.5,值得注意的數字不是價格,而是一項便宜模型擊敗昂貴模型的基準測試。根據 Anthropic 自行公布的成績單,Sonnet 5.5 在代理式程式開發評測 Terminal-Bench 4.0 上取得 70.6%,Claude Opus 5.5 為 66.4%。推出已三個月的 Sonnet 5 在同一項測試只有 10.3%。
Key takeaways
- Sonnet 5.5 在 Terminal-Bench 4.0 拿下 70.6%,勝過價格更高的 Opus 5.5 的 66.4%。
- 價格與 Sonnet 5 相同,每百萬輸入 token 2 美元、每百萬輸出 token 10 美元;成本節省來自消耗較少 token,而非調降費率。
- Balyasny Asset Management 表示,Sonnet 5 每則答覆要花 49 萬 7000 個 token,如今只需 12 萬 1000 個。
三成成本究竟省在哪裡
Anthropic 主打的數字是生成速度提升三成以上、每項任務成本最多降低三成。第二個數字容易被誤讀。標價並未變動:輸入仍是每百萬 token 2 美元、輸出 10 美元,快取讀取 0.20 美元、快取寫入 2.50 美元。節省來自模型以更少的 token 與更少的工具呼叫完成工作,這是另一種性質的進步,只有在工作負載屬於代理式時才會反映在帳單上。
Anthropic 一併公布的客戶數據讓這點具體可見。Slack 表示在幾乎所有評測上都追平或超越 Sonnet 5,步驟更少,輸出 token 約減少 14%。Box 量測到結果快 2.4 倍、總 token 減少 12%。Lovable 說任務完成所需的工具呼叫少了三分之一,shell 執行次數約減半。最鮮明的數字來自 Balyasny Asset Management:Sonnet 5 燒掉 49 萬 7000 個 token 的答覆,如今以 12 萬 1000 個完成。
怎麼讀這張基準測試表
Sonnet 5.5 幾乎在每個項目都貼近 Opus 5.5,並在一處超前。OSWorld 2.1 上它得 80.1%,不及 Opus 5.5 的 81.8%,但遠高於 Sonnet 5 的 57.0%。Humanity's Last Exam 是 64.5% 對 67.7%。GDPval-AA v2.1 兩者為 1844 與 1846,實質打成平手;AA-Briefcase v1.1 則是 1811 對 1822,差距很小。Terminal-Bench 也是 Anthropic 歸類為代理式程式開發的三項測試中,Sonnet 5.5 唯一勝出的一項:CursorBench 4.0 由 Opus 5.5 以 57.8% 對 55.5% 領先,FrontierCode 1.1 是 54.4% 對 46.2%。Anthropic 指出,Sonnet 5.5 在 FrontierCode 上的 Max 設定分數低於 Xhigh,因為在 Max 之下它更常執行程式碼審查技能,產生超出範圍的修改與逾時,而基準測試會為此扣分。
真正該謹慎看待的是 Sonnet 5 那一欄。Terminal-Bench 4.0 從 10.3% 跳到 70.6%、Chartography 從 15.6% 跳到 61.6%,說明的是上一代難以應付這些特定測試環境,而不是能力成長了七倍。該讀的同級比較是 Sonnet 5.5 對 Opus 5.5,而那組數字告訴我們:中階模型在多數工作上已經和旗艦只差幾分,同時能在同樣的預算內開出更多並行代理。
Anthropic 為它加上的降級機制
Sonnet 5.5 帶著前幾代沒有的限制上線。Anthropic 表示,風險較高的資安任務會明顯降回 Sonnet 5 處理,這是明確的降級而非拒答。TechCrunch 報導,這讓 Sonnet 成為第一個被納入原本僅適用於 Opus 與 Fable 的資安防護措施的中階模型,理由是它的資安能力如今已接近 Opus 5。它也是第一款出廠即內建分類器、用於阻止競爭對手擷取其推理過程進行蒸餾的 Sonnet。生物領域的防護措施則沿用 Sonnet 5 未做變動。
背景:戰場在中階
已經沒有人在旗艦價格上競爭。OpenAI 上週以 Sol 與 Luna 把中階 token 價格砍半,Meta 則發表了驅動智慧眼鏡功能的模型。Anthropic 的答案不是更便宜的價目表,而是一個消耗更少的模型,再加上提示快取最多 90%、批次處理 50% 的節省。
展望
Sonnet 5.5 可在 Claude.ai 使用,開發者則可透過 Claude Platform 以及 Amazon Web Services、Google Cloud 與 Microsoft Azure,以 claude-sonnet-5-5 這個識別碼呼叫。改版的 Haiku 預計數週內推出,未承諾具體日期。留下的問題是 Opus 5.5 還能做什麼:如果便宜的模型拿下終端機程式開發的基準測試,又在知識工作上打平,旗艦剩下的理由就只有面對難以量化評測的問題時的判斷力。
FAQ・常見問題
Claude Sonnet 5.5 比 Sonnet 5 貴嗎
不貴,價格完全相同:每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取讀取 0.20 美元、快取寫入 2.50 美元。Anthropic 所說的每項任務成本最多降低三成,來自模型使用更少的 token 與工具呼叫,不是費率下降。
Sonnet 5.5 真的贏過 Opus 5.5 嗎
在代理式程式開發評測 Terminal-Bench 4.0 上是的,70.6% 對 66.4%,而 Anthropic 指出 Opus 5.5 這個數字來自其最高效能設定。這也是 Anthropic 公布的三項代理式程式開發基準測試中,Sonnet 5.5 唯一領先的一項;CursorBench 4.0 與 FrontierCode 1.1 都由 Opus 5.5 勝出。Opus 5.5 在 OSWorld 2.1 與 Humanity's Last Exam 上也以一到三分的差距維持小幅領先。
開發者可以在哪裡使用 Sonnet 5.5
它原生提供於 Claude Platform,也可透過 Amazon Web Services、Google Cloud 與 Microsoft Azure 使用,模型識別碼為 claude-sonnet-5-5。一般使用者可從 Claude.ai 取用。






