AI Newsway

Claude Opus 5.5 降價兩成,但部分請求會交給舊版模型處理

快取讀取的降幅比表定價格更重要,而一則基準測試註腳揭露了你的請求何時不再由 Opus 5.5 回答

|5分鐘閱讀0
Server racks of the kind that serve frontier model inference, where cache-read pricing decides the cost of long-running Claude Opus 5.5 agent sessions.
Server racks of the kind that serve frontier model inference, where cache-read pricing decides the cost of long-running Claude Opus 5.5 agent sessions.

Anthropic 這次 Claude Opus 5.5 發表中最關鍵的數字,並不是多數報導拿來當標題的那一個。輸入與輸出代幣確實降了兩成,來到每百萬4美元與20美元。但快取讀取下調六成,降至每百萬0.20美元——對這款模型主打的長時間代理工作階段而言,決定帳單的正是這一項。

重點摘要

  • Claude Opus 5.5 定價為每百萬輸入代幣4美元、每百萬輸出代幣20美元,快取讀取為每百萬0.20美元,比 Opus 5 低六成。
  • Anthropic 為這款模型加上正式環境防護機制,機制啟動時,資安類工作由 Claude Opus 4.8 完成,生物學與前沿模型開發類工作則由 Claude Opus 5 完成。
  • Opus 5.5 在 Terminal-Bench 4.0 拿下66.4%、GDPval-AA v2.1 為1846 Elo,同時領先 Claude Fable 5.1 與 OpenAI 的 GPT-6 Astra。

為何快取價格決定代理的經濟效益

通宵處理程式碼庫的 AI 代理不會每一輪都送出全新脈絡,而是一再重送同一份系統提示、同一組工具定義與同一批檔案。這些重播的前綴就是快取讀取,在以小時而非秒計的工作階段裡,它主宰了整個計費。

Anthropic 自己的說法也承認這點,形容快取讀取占了代理與程式開發工作成本的大部分。因此這裡降六成,對一場通宵遷移的幫助遠大於新輸入降兩成所能帶來的效果。只用輸出代幣來編列 Opus 5 預算的團隊,一直都在模擬錯的變數。

吞吐量也朝同方向走。輸出生成速度比 Opus 5 快超過三成。Claude Code 與 Claude Platform 內另有 Fast 模式,以每百萬代幣8美元與40美元把價格換成低延遲,號稱最高2.5倍速度。Pro、Max、Team 與按席次計費的 Enterprise 方案,五小時用量上限同步調高,訂閱者現在還能把速率限制重置額度存起來,等到截止期限逼近時再用。

你的請求何時不再是 Opus 5.5

採購方應該把其中一則註腳讀兩遍。由於 Opus 5.5 在生物學與資安能力上逼近 Claude Mythos 5.1,Anthropic 是套上原本為 Fable 5.1 打造的防護機制才出貨。機制啟動時請求不會失敗,而是由另一款模型接手完成。

資安類任務由 Claude Opus 4.8 完成,生物學與前沿 LLM 開發任務則由 Claude Opus 5 完成。

這是公開揭露而非隱瞞,作為安全設計也站得住腳。但這同時意味著,在一項你按前沿價碼付費的產品內部,能力被悄悄換掉了。任何在 API 上打造資安工具的團隊,都該假設有一部分流量是由落後兩個版本的模型回答的。真正該問的不是這種轉交是否合理,而是你的評測環境能不能告訴你它何時啟動——因為回應看起來與其他回應毫無二致。

這套機制也扭曲了排行榜。Zapier 在未設定備援模型的情況下跑 AutomationBench,於是每一次防護機制介入都被記為失敗,這正是 Opus 5.5 以40.0%落後 GPT-6 Astra 41.4%的由來。Anthropic 主張正式部署環境不會丟掉那些分數。OpenAI 的對照圖表則從另一側呈現同一套機制:設定 Opus 5 為備援的 Fable 5.1 組態達到31.4%,而 OpenAI 也承認該成本數字並未計入約四成任務上啟動的備援處理。

測試者實際量到的東西

Anthropic 公布的證據多半關乎產出量,而非聰明程度。一名測試者在一天內完成68萬行的程式碼遷移;另一名在三小時內稽核並修復20萬行的程式碼庫,而 Opus 5 得花超過20小時、耗用2.5倍代幣。一項把 HAProxy 由 C 移植到 Rust 的內部工作,以9.5小時完成,Fable 5.1 則要12小時,成本低了51%。

這些都不是智力宣稱,而是吞吐量宣稱,而吞吐量正是把模型升級變成預算項目的關鍵。客戶端的數字重複同一種樣態:步驟更少、輸出更短、結果持平或更好。Deloitte 發現這款模型在最低推理強度下,於程式碼審查中抓到72%的已知缺陷,而高強度的 Opus 5 只有56%。Hebbia 在專家評分的金融工作流程上給出86.6%的覆蓋率,Opus 5 為60.3%。在公開基準測試中,Opus 5.5 於 Terminal-Bench 4.0 取得66.4%、GDPval-AA v2.1 為1846 Elo,同一指標上 Fable 5.1 為1735、GPT-6 Astra 為1542。

連自家執行長都說太快的節奏

最不自在的部分是行事曆。The Register 統計,Fable 5.1 與 Opus 5.5 相隔21天,Opus 5 與 Fable 5.1 相隔39天;而執行長 Dario Amodei 公開呼籲放慢能力躍進,是在這次發表的十天前。Anthropic 選在 OpenAI 推出 GPT-6 Sol 與 Luna 的同一個早上出貨,距離 GPT-6 Astra 抵達企業客戶剛好三週。完整內容可見 Anthropic 的發表文章。Sonnet 5.5 與 Haiku 5.5 將在未來數週跟進,屆時快取讀取的降價才會對最大量的工作負載產生意義。

FAQ — 常見問題

Claude Opus 5.5 的價格是多少?

Opus 5.5 為每百萬輸入代幣4美元、每百萬輸出代幣20美元,比 Opus 5 低兩成。快取讀取為每百萬0.20美元,降幅六成。Claude Code 與 Claude Platform 中另有 Fast 模式,每百萬代幣8美元與40美元,速度最高可達2.5倍。

Anthropic 會把我的 Opus 5.5 請求轉給舊版模型嗎?

在少數情形下會。Anthropic 表示,當 Opus 5.5 的正式環境防護機制介入時,資安類任務由 Claude Opus 4.8 完成,生物學與前沿模型開發任務則由 Claude Opus 5 完成。通過審核的組織可申請 Anthropic 的 Life Sciences Verification Program,Cyber Verification Program 也將在未來數週擴大。

Opus 5.5 比 GPT-6 Astra 更好嗎?

視任務而定。Opus 5.5 在 Terminal-Bench 4.0(66.4%對57.9%)與 GDPval-AA v2.1(1846 Elo 對1542)領先,Astra 則在 AutomationBench(41.4%對40.0%)與 Terminal-Bench-Science 0.1(64.6%對58.7%)領先。兩家實驗室在不同評測環境與推理強度下執行這些測試,因此差距無法直接比較。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

OpenAI 中階模型代幣價格砍半,但兩項基準測試仍由 GPT-5.6 勝出
Developer Tools

OpenAI 中階模型代幣價格砍半,但兩項基準測試仍由 GPT-5.6 勝出

OpenAI 週二推出兩款中階模型,訴求幾乎全押在價格上。GPT-6 Sol 每百萬輸入代幣定價2美元,每百萬輸出代幣10美元。

Seung Jung8 小時前
GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上
LLM & Chatbots

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上

OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。

Seung Jung13 天前
Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡
LLM & Chatbots

Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡

Meta釋出個人AI智慧體Muse,在美國通過iOS、安卓、網頁和WhatsApp代替使用者訂行程、付賬單和購物。

Seung Jung12 天前
Anthropic警告:資訊竊取木馬正在耗盡付費Claude賬戶額度
LLM & Chatbots

Anthropic警告:資訊竊取木馬正在耗盡付費Claude賬戶額度

Anthropic正向登入會話被資訊竊取木馬盜走的Claude使用者傳送郵件,攻擊者無需密碼即可花光其付費用量額度。

Seung Jung13 天前
Claude只對成年人開放,而它的年齡識別正在誤封成年使用者
LLM & Chatbots

Claude只對成年人開放,而它的年齡識別正在誤封成年使用者

Anthropic公開了Claude執行18歲以上政策的具體機制:分類器會停用疑似未成年人的賬號,被誤判的成年使用者可通過Yoti驗證恢復訪問。

Seung Jung12 天前
OpenAI同日推出Data智慧體與華爾街版ChatGPT
LLM & Chatbots

OpenAI同日推出Data智慧體與華爾街版ChatGPT

OpenAI在同一個星期四釋出了面向ChatGPT Work的Data智慧體,以及與Morgan Stanley、Evercore共建的ChatGPT for Financial Services。

Seung Jung13 天前