AI Newsway

Opus 5.5在最大努力設定下,等了682秒才吐出第一個token

Artificial Analysis給Anthropic旗艦模型的這組設定打了Intelligence Index 58分,同級中位數為26分;而這個分數是用2億6000萬個輸出token、每項任務5.98美元換來的。

|4分鐘閱讀0
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.

Anthropic最新旗艦模型的第三方數據出爐了,描繪出的是一個站上榜首、但代價異常高昂的模型。Artificial Analysis替採用自適應推理、最大努力、預設回退這組設定的Claude Opus 5.5打出Intelligence Index v4.3.2的58分,大幅領先同價位推理模型的26分中位數。同一頁面列出的首個token時間是682.71秒,中位數則是3.79秒。

重點摘要

  • 最大努力設定下的Opus 5.5在Artificial Analysis Intelligence Index v4.3.2拿到58分,同級推理模型的中位數為26分。
  • 跑完整套指數耗掉2億6000萬個輸出token,約是8800萬中位數的三倍,每項任務平均花費5.98美元。
  • Artificial Analysis為這組設定記下的首個token時間是682.71秒,中位數為3.79秒;不過一旦開始生成,輸出速度達每秒95.5個token。

這個指數實際上在量什麼

Intelligence Index v4.3.2是十項評測合成的分數,涵蓋AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience與AA-LCR v1.1。裡頭混雜了代理式工作任務、終端操作、科學程式撰寫與長上下文檢索,所以單一數字受工具使用行為的影響,不亞於受純粹知識的影響。

Artificial Analysis是拿商用模型跟同一混合價位區間的對手比,而不是跟整個業界比,因此26分是同儕比較值,不是產業平均。Opus 5.5接受文字與圖片輸入、回傳文字,並配備100萬token的上下文視窗。

成本在token,不在價目表

Anthropic公布的價格是每百萬輸入token 4.00美元、每百萬輸出token 20.00美元,同價位區間的中位數則是2.00與10.00美元,帳面上是兩倍溢價。把囉嗦程度算進去之後,這道差距還會再拉開。中位數模型用8800萬token就跑完的指數,Opus 5.5用掉2億6000萬個輸出token,每項任務平均落在5.98美元。

要帶進預算表的正是這個數字。Anthropic在發表時把Opus 5.5的定價訂得比前一代低約20%,但面對一個多思考三倍的模型,單價調降撐不住。用請求數而非token計費控管支出的團隊,會最先感受到差別。

該怎麼讀682秒這個數字

這項延遲數據必須把但書講清楚。它只適用於先把思考做完再產出的最大努力自適應推理設定,而且Artificial Analysis是把首個回答token時間與首個token時間當成兩個指標分開追蹤。這是對單一設定的量測,不是對所有打進API的請求。

話雖如此,682.71秒是超過11分鐘的沉默,而它旁邊擺著的是生成開始後每秒95.5個token這種高於平均的速度。這種曲線形狀直接牽動產品設計:全力運轉的Opus 5.5是批次工具,不是互動工具。任何期待在請求逾時前拿到回應的環節,都得把努力度調低。而設定名稱裡的「預設回退」本身就在提醒:Anthropic附了一道可以把工作轉給舊模型的保險。

這批數據出爐的同一週,開發者剛找出Opus 5.5上會回400錯誤的四種請求寫法,Anthropic自家的系統卡也揭露在1.5%的對抗性測試中出現沙箱逃逸嘗試。三件事指向同一幅圖像:能力最強的那組設定,也是營運上要繞開的稜角最多的一組。

FAQ — 常見問題

每次呼叫Opus 5.5都要等11分鐘嗎

不會。這個數字來自最大努力的自適應推理設定,它會先把預算花在推理上再作答。努力度調低後行為就不同,而且Artificial Analysis是把首個回答token時間與首個token時間分開回報的。

單價既然降了,token數量為何還重要

因為計費跟著token走,不是跟著請求走。Opus 5.5跑完Intelligence Index產出2億6000萬個輸出token,中位數只有8800萬,所以價目表變便宜,帳單仍可能變貴——這次是每項任務平均5.98美元。

Artificial Analysis Intelligence Index是什麼

它是由十項公開與非公開評測組成的合成分數,目前版本為4.3.2,涵蓋代理式任務、程式撰寫、長上下文與知識。模型只在同級之內比較,因此推理模型是跟同價位的推理與非推理模型一起排名。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上
LLM & Chatbots

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上

OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。

Seung Jung18 天前
Anthropic警告:資訊竊取木馬正在耗盡付費Claude賬戶額度
LLM & Chatbots

Anthropic警告:資訊竊取木馬正在耗盡付費Claude賬戶額度

Anthropic正向登入會話被資訊竊取木馬盜走的Claude使用者傳送郵件,攻擊者無需密碼即可花光其付費用量額度。

Seung Jung18 天前
Claude只對成年人開放,而它的年齡識別正在誤封成年使用者
LLM & Chatbots

Claude只對成年人開放,而它的年齡識別正在誤封成年使用者

Anthropic公開了Claude執行18歲以上政策的具體機制:分類器會停用疑似未成年人的賬號,被誤判的成年使用者可通過Yoti驗證恢復訪問。

Seung Jung17 天前
Claude Opus 5.5 降價兩成,但部分請求會交給舊版模型處理
LLM & Chatbots

Claude Opus 5.5 降價兩成,但部分請求會交給舊版模型處理

Claude Opus 5.5 以每百萬代幣4/20美元登場,快取讀取下調六成,並內建可把部分工作轉交舊版 Claude 模型的防護機制。

Seung Jung5 天前
Grok 4.7價格不動,終端機分數翻倍,爭點仍是帳單
LLM & Chatbots

Grok 4.7價格不動,終端機分數翻倍,爭點仍是帳單

前沿模型發表通常伴隨漲價,SpaceXAI在9月21日正式推出的Grok 4.7沒有。輸入維持每百萬token 2美元、輸出6美元。

Seung Jung7 天前
Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡
LLM & Chatbots

Meta的Muse智慧體,盯上了你的郵箱、日曆和信用卡

Meta釋出個人AI智慧體Muse,在美國通過iOS、安卓、網頁和WhatsApp代替使用者訂行程、付賬單和購物。

Seung Jung17 天前