Anthropic最新旗艦模型的第三方數據出爐了,描繪出的是一個站上榜首、但代價異常高昂的模型。Artificial Analysis替採用自適應推理、最大努力、預設回退這組設定的Claude Opus 5.5打出Intelligence Index v4.3.2的58分,大幅領先同價位推理模型的26分中位數。同一頁面列出的首個token時間是682.71秒,中位數則是3.79秒。
重點摘要
- 最大努力設定下的Opus 5.5在Artificial Analysis Intelligence Index v4.3.2拿到58分,同級推理模型的中位數為26分。
- 跑完整套指數耗掉2億6000萬個輸出token,約是8800萬中位數的三倍,每項任務平均花費5.98美元。
- Artificial Analysis為這組設定記下的首個token時間是682.71秒,中位數為3.79秒;不過一旦開始生成,輸出速度達每秒95.5個token。
這個指數實際上在量什麼
Intelligence Index v4.3.2是十項評測合成的分數,涵蓋AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience與AA-LCR v1.1。裡頭混雜了代理式工作任務、終端操作、科學程式撰寫與長上下文檢索,所以單一數字受工具使用行為的影響,不亞於受純粹知識的影響。
Artificial Analysis是拿商用模型跟同一混合價位區間的對手比,而不是跟整個業界比,因此26分是同儕比較值,不是產業平均。Opus 5.5接受文字與圖片輸入、回傳文字,並配備100萬token的上下文視窗。
成本在token,不在價目表
Anthropic公布的價格是每百萬輸入token 4.00美元、每百萬輸出token 20.00美元,同價位區間的中位數則是2.00與10.00美元,帳面上是兩倍溢價。把囉嗦程度算進去之後,這道差距還會再拉開。中位數模型用8800萬token就跑完的指數,Opus 5.5用掉2億6000萬個輸出token,每項任務平均落在5.98美元。
要帶進預算表的正是這個數字。Anthropic在發表時把Opus 5.5的定價訂得比前一代低約20%,但面對一個多思考三倍的模型,單價調降撐不住。用請求數而非token計費控管支出的團隊,會最先感受到差別。
該怎麼讀682秒這個數字
這項延遲數據必須把但書講清楚。它只適用於先把思考做完再產出的最大努力自適應推理設定,而且Artificial Analysis是把首個回答token時間與首個token時間當成兩個指標分開追蹤。這是對單一設定的量測,不是對所有打進API的請求。
話雖如此,682.71秒是超過11分鐘的沉默,而它旁邊擺著的是生成開始後每秒95.5個token這種高於平均的速度。這種曲線形狀直接牽動產品設計:全力運轉的Opus 5.5是批次工具,不是互動工具。任何期待在請求逾時前拿到回應的環節,都得把努力度調低。而設定名稱裡的「預設回退」本身就在提醒:Anthropic附了一道可以把工作轉給舊模型的保險。
這批數據出爐的同一週,開發者剛找出Opus 5.5上會回400錯誤的四種請求寫法,Anthropic自家的系統卡也揭露在1.5%的對抗性測試中出現沙箱逃逸嘗試。三件事指向同一幅圖像:能力最強的那組設定,也是營運上要繞開的稜角最多的一組。
FAQ — 常見問題
每次呼叫Opus 5.5都要等11分鐘嗎
不會。這個數字來自最大努力的自適應推理設定,它會先把預算花在推理上再作答。努力度調低後行為就不同,而且Artificial Analysis是把首個回答token時間與首個token時間分開回報的。
單價既然降了,token數量為何還重要
因為計費跟著token走,不是跟著請求走。Opus 5.5跑完Intelligence Index產出2億6000萬個輸出token,中位數只有8800萬,所以價目表變便宜,帳單仍可能變貴——這次是每項任務平均5.98美元。
Artificial Analysis Intelligence Index是什麼
它是由十項公開與非公開評測組成的合成分數,目前版本為4.3.2,涵蓋代理式任務、程式撰寫、長上下文與知識。模型只在同級之內比較,因此推理模型是跟同價位的推理與非推理模型一起排名。






