AI Newsway

Anthropic Sonnet 5.5 在代理式程式開發上勝過 Opus 5.5

中階模型維持 Sonnet 5 每百萬輸入 token 2 美元的價格,Anthropic 同時主張速度提升三成、每項任務成本最多降低三成

|5分鐘閱讀0
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.

Anthropic 於當地時間 28 日推出 Claude Sonnet 5.5,值得注意的數字不是價格,而是一項便宜模型擊敗昂貴模型的基準測試。根據 Anthropic 自行公布的成績單,Sonnet 5.5 在代理式程式開發評測 Terminal-Bench 4.0 上取得 70.6%,Claude Opus 5.5 為 66.4%。推出已三個月的 Sonnet 5 在同一項測試只有 10.3%。

Key takeaways

  • Sonnet 5.5 在 Terminal-Bench 4.0 拿下 70.6%,勝過價格更高的 Opus 5.5 的 66.4%。
  • 價格與 Sonnet 5 相同,每百萬輸入 token 2 美元、每百萬輸出 token 10 美元;成本節省來自消耗較少 token,而非調降費率。
  • Balyasny Asset Management 表示,Sonnet 5 每則答覆要花 49 萬 7000 個 token,如今只需 12 萬 1000 個。

三成成本究竟省在哪裡

Anthropic 主打的數字是生成速度提升三成以上、每項任務成本最多降低三成。第二個數字容易被誤讀。標價並未變動:輸入仍是每百萬 token 2 美元、輸出 10 美元,快取讀取 0.20 美元、快取寫入 2.50 美元。節省來自模型以更少的 token 與更少的工具呼叫完成工作,這是另一種性質的進步,只有在工作負載屬於代理式時才會反映在帳單上。

Anthropic 一併公布的客戶數據讓這點具體可見。Slack 表示在幾乎所有評測上都追平或超越 Sonnet 5,步驟更少,輸出 token 約減少 14%。Box 量測到結果快 2.4 倍、總 token 減少 12%。Lovable 說任務完成所需的工具呼叫少了三分之一,shell 執行次數約減半。最鮮明的數字來自 Balyasny Asset Management:Sonnet 5 燒掉 49 萬 7000 個 token 的答覆,如今以 12 萬 1000 個完成。

怎麼讀這張基準測試表

Sonnet 5.5 幾乎在每個項目都貼近 Opus 5.5,並在一處超前。OSWorld 2.1 上它得 80.1%,不及 Opus 5.5 的 81.8%,但遠高於 Sonnet 5 的 57.0%。Humanity's Last Exam 是 64.5% 對 67.7%。GDPval-AA v2.1 兩者為 1844 與 1846,實質打成平手;AA-Briefcase v1.1 則是 1811 對 1822,差距很小。Terminal-Bench 也是 Anthropic 歸類為代理式程式開發的三項測試中,Sonnet 5.5 唯一勝出的一項:CursorBench 4.0 由 Opus 5.5 以 57.8% 對 55.5% 領先,FrontierCode 1.1 是 54.4% 對 46.2%。Anthropic 指出,Sonnet 5.5 在 FrontierCode 上的 Max 設定分數低於 Xhigh,因為在 Max 之下它更常執行程式碼審查技能,產生超出範圍的修改與逾時,而基準測試會為此扣分。

真正該謹慎看待的是 Sonnet 5 那一欄。Terminal-Bench 4.0 從 10.3% 跳到 70.6%、Chartography 從 15.6% 跳到 61.6%,說明的是上一代難以應付這些特定測試環境,而不是能力成長了七倍。該讀的同級比較是 Sonnet 5.5 對 Opus 5.5,而那組數字告訴我們:中階模型在多數工作上已經和旗艦只差幾分,同時能在同樣的預算內開出更多並行代理。

Anthropic 為它加上的降級機制

Sonnet 5.5 帶著前幾代沒有的限制上線。Anthropic 表示,風險較高的資安任務會明顯降回 Sonnet 5 處理,這是明確的降級而非拒答。TechCrunch 報導,這讓 Sonnet 成為第一個被納入原本僅適用於 Opus 與 Fable 的資安防護措施的中階模型,理由是它的資安能力如今已接近 Opus 5。它也是第一款出廠即內建分類器、用於阻止競爭對手擷取其推理過程進行蒸餾的 Sonnet。生物領域的防護措施則沿用 Sonnet 5 未做變動。

背景:戰場在中階

已經沒有人在旗艦價格上競爭。OpenAI 上週以 Sol 與 Luna 把中階 token 價格砍半,Meta 則發表了驅動智慧眼鏡功能的模型。Anthropic 的答案不是更便宜的價目表,而是一個消耗更少的模型,再加上提示快取最多 90%、批次處理 50% 的節省。

展望

Sonnet 5.5 可在 Claude.ai 使用,開發者則可透過 Claude Platform 以及 Amazon Web Services、Google Cloud 與 Microsoft Azure,以 claude-sonnet-5-5 這個識別碼呼叫。改版的 Haiku 預計數週內推出,未承諾具體日期。留下的問題是 Opus 5.5 還能做什麼:如果便宜的模型拿下終端機程式開發的基準測試,又在知識工作上打平,旗艦剩下的理由就只有面對難以量化評測的問題時的判斷力。

FAQ・常見問題

Claude Sonnet 5.5 比 Sonnet 5 貴嗎

不貴,價格完全相同:每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取讀取 0.20 美元、快取寫入 2.50 美元。Anthropic 所說的每項任務成本最多降低三成,來自模型使用更少的 token 與工具呼叫,不是費率下降。

Sonnet 5.5 真的贏過 Opus 5.5 嗎

在代理式程式開發評測 Terminal-Bench 4.0 上是的,70.6% 對 66.4%,而 Anthropic 指出 Opus 5.5 這個數字來自其最高效能設定。這也是 Anthropic 公布的三項代理式程式開發基準測試中,Sonnet 5.5 唯一領先的一項;CursorBench 4.0 與 FrontierCode 1.1 都由 Opus 5.5 勝出。Opus 5.5 在 OSWorld 2.1 與 Humanity's Last Exam 上也以一到三分的差距維持小幅領先。

開發者可以在哪裡使用 Sonnet 5.5

它原生提供於 Claude Platform,也可透過 Amazon Web Services、Google Cloud 與 Microsoft Azure 使用,模型識別碼為 claude-sonnet-5-5。一般使用者可從 Claude.ai 取用。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Opus 5.5在最大努力設定下,等了682秒才吐出第一個token
LLM & Chatbots

Opus 5.5在最大努力設定下,等了682秒才吐出第一個token

Artificial Analysis測得Claude Opus 5.5最大努力設定的首個token延遲為682.71秒,同級模型的中位數是3.79秒。

Seung Jung19 小時前
Anthropic警告:資訊竊取木馬正在耗盡付費Claude賬戶額度
LLM & Chatbots

Anthropic警告:資訊竊取木馬正在耗盡付費Claude賬戶額度

Anthropic正向登入會話被資訊竊取木馬盜走的Claude使用者傳送郵件,攻擊者無需密碼即可花光其付費用量額度。

Seung Jung19 天前
Mercury 2.5 上線:每秒1,107個詞元,百萬詞元四美分
LLM & Chatbots

Mercury 2.5 上線:每秒1,107個詞元,百萬詞元四美分

一家電話智慧體初創公司稱,Mercury 把最差情況下的響應時間從數分鐘壓到了一秒。Inception Labs 的新擴散模型正是圍繞這類數字打造的。

Seung Jung15 天前
Claude只對成年人開放,而它的年齡識別正在誤封成年使用者
LLM & Chatbots

Claude只對成年人開放,而它的年齡識別正在誤封成年使用者

Anthropic公開了Claude執行18歲以上政策的具體機制:分類器會停用疑似未成年人的賬號,被誤判的成年使用者可通過Yoti驗證恢復訪問。

Seung Jung17 天前
Claude Opus 5.5 降價兩成,但部分請求會交給舊版模型處理
LLM & Chatbots

Claude Opus 5.5 降價兩成,但部分請求會交給舊版模型處理

Claude Opus 5.5 以每百萬代幣4/20美元登場,快取讀取下調六成,並內建可把部分工作轉交舊版 Claude 模型的防護機制。

Seung Jung6 天前
OpenAI新心理健康評測,最高分只有57.3%
LLM & Chatbots

OpenAI新心理健康評測,最高分只有57.3%

OpenAI與22國80多位臨床人員共同打造的MentalHealthBench,最高分是GPT-6 Astra的57.3%,Claude Opus 5.5為52.4%。

Seung Jung23 小時前