AI Newsway

Grok 4.7價格不動,終端機分數翻倍,爭點仍是帳單

SpaceXAI隔一個月推出新前沿模型卻沒調整$2/$6定價,把每一道效能差距都變成「每分成本」的問題

|4分鐘閱讀0
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains

前沿模型發表通常會附帶漲價。SpaceXAI在9月21日正式推出的Grok 4.7沒有。輸入仍是每百萬token 2美元、輸出6美元,和一個月前的Grok 4.6標價相同,而正是這個決定讓其餘成績單變得值得一看。

重點摘要(Key takeaways)

  • Grok 4.7沿用每百萬token輸入2美元、輸出6美元的定價,約為Claude Fable 5.1輸入價的五分之一、輸出價的八分之一。
  • Terminal-Bench 4.0分數一個世代之間從20.3%升到38.0%,是這次發表中最大的單項躍升。
  • 所有數字都出自SpaceXAI自家評測,而掛在最前面的那項benchmark,由SpaceX上個月完成收購的Cursor維護。

為何價格不動比那些勝場更重要

採購代理式算力的人買的不是benchmark分數,而是長時間任務會以難以預估的速度吃掉的token。以2美元和6美元計,Grok 4.7低於GPT-5.6 Sol的4美元與20美元,更遠低於Fable 5.1的10美元與50美元。已經照Grok 4.6編好預算的團隊,等於零增量成本承接這次升級——在能力一跳、整層價格就跟著重訂的市場裡,這相當少見。

這也改變了輸掉那些項目的讀法。在Grok 4.7落後之處,問題不是這個模型有沒有跟上,而是那段差距值不值得多付五到八倍的token帳單。

七項benchmark一次看

SpaceXAI以xHigh強度跑Grok 4.7,對照Grok 4.6的High,以及GPT-5.6 Sol與Fable 5.1的Max。

BenchmarkGrok 4.7Grok 4.6GPT-5.6 SolFable 5.1
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

*為High強度下的分數。

直接計算,這是對Sol五勝、對Fable 5.1三勝,而且每一列都優於Grok 4.6。電機工程與法律兩項的差距懸殊到足以顯示,競爭對手根本沒有針對這些領域訓練。Terminal-Bench則完全相反:Fable 5.1的57.9%領先近二十個百分點,長達數小時的終端機作業,仍是多付錢確實買得到東西的最明顯場域。

SpaceXAI做了哪些調整

該公司把進步歸因於更大的基礎模型,以及一輪延長的強化學習,訓練重心偏向以小時而非分鐘計的任務。發表指出,自我驗證與長脈絡處理因此改善,模型也額外訓練成能原生操作Grok Bot harness。這個細節值得留意,因為決定代理在開放式任務中表現的,往往是對harness的熟悉度而非純粹的推理能力。

安全機制同步重建。SpaceXAI表示,模型在LatchBio的生物安全benchmark取得62.4%,在自家HackerBench v0.3上,危險雙用途提示的通過率為3.3%,並已開始開放受邀的資安夥伴使用模型的紅隊能力。

兩個要記住的但書

第一是來源。排在發表最前面的CursorBench 4.0,其維護者Cursor在上個月的收購後已是SpaceX子公司——自家benchmark佔據頭條位置,這個數字在流傳出去之前需要獨立複現。第二是取樣:本月稍早以高於Sol的價格推出的OpenAI GPT-6 Astra,只出現在次要圖表中,Grok 4.7在該處的1,695 Elo高於Astra的1,542,但落後Anthropic的1,735。

Grok 4.7已在Cursor與Grok Build上線,也可透過Grok API、第三方harness、路由服務與雲端平台取用。就像Grok 4.6發表那次一樣,真正的考驗不是發表當天的表格,而是接下來幾週中立評測機構量出來的數字。

FAQ・常見問題

Grok 4.7怎麼收費?

每百萬輸入token 2美元、每百萬輸出token 6美元,與Grok 4.6相同。另有輸出速度加倍的版本,價格也加倍。

Grok 4.7比Claude Fable 5.1好嗎?

視任務而定。Grok 4.7在DeepSWE v1.1、EEBench與Harvey法律benchmark領先;Fable 5.1在CursorBench 4.0、AA Briefcase、Terminal-Bench 4.0與HealthBench Professional領先,但輸入token單價貴上五倍。

Grok 4.7的benchmark結果有經過獨立驗證嗎?

沒有。所有公布分數都來自SpaceXAI自己的評測,CursorBench則由SpaceX上個月收購的Cursor維護,第三方結果尚未出爐。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上
LLM & Chatbots

GPT-6 Astra上崗:OpenAI最貴模型把全部籌碼押在電腦操作上

OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。

Seung Jung12 天前
Mercury 2.5 上線:每秒1,107個詞元,百萬詞元四美分
LLM & Chatbots

Mercury 2.5 上線:每秒1,107個詞元,百萬詞元四美分

一家電話智慧體初創公司稱,Mercury 把最差情況下的響應時間從數分鐘壓到了一秒。Inception Labs 的新擴散模型正是圍繞這類數字打造的。

Seung Jung8 天前
名字沒變,權重換了:API 模型名到底保證了什麼
LLM & Chatbots

名字沒變,權重換了:API 模型名到底保證了什麼

一個被鎖定的端點標識即將返回另一套權重,且無法拒絕。工程師認為,這打破了他們賴以工作的變更管理約定。

Seung Jung12 天前
ChatGPT Images 2.5生成延遲減半,新增手繪畫布
LLM & Chatbots

ChatGPT Images 2.5生成延遲減半,新增手繪畫布

OpenAI推出ChatGPT Images 2.5,延遲最多降低50%,新增Sketch繪圖畫布、模板、定點批註,並向API釋出兩款新模型。

Seung Jung11 天前
ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%
LLM & Chatbots

ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%

一份針對 1,536 則 AI 購物回答的稽核發現,ChatGPT 有 79% 以第一人稱表態偏好,Gemini 僅 7%,兩者引用的來源也幾乎不重疊。

Seung Jung5 天前
Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口
LLM & Chatbots

Gemini登陸Windows:一個Alt+Space快捷鍵,直撲桌面入口

谷歌Windows版Gemini原生應用可用Alt+Space浮在任意程式之上,接入Gmail和Google Drive,面向全球Windows 10和11開放。

Seung Jung11 天前