前沿模型發表通常會附帶漲價。SpaceXAI在9月21日正式推出的Grok 4.7沒有。輸入仍是每百萬token 2美元、輸出6美元,和一個月前的Grok 4.6標價相同,而正是這個決定讓其餘成績單變得值得一看。
重點摘要(Key takeaways)
- Grok 4.7沿用每百萬token輸入2美元、輸出6美元的定價,約為Claude Fable 5.1輸入價的五分之一、輸出價的八分之一。
- Terminal-Bench 4.0分數一個世代之間從20.3%升到38.0%,是這次發表中最大的單項躍升。
- 所有數字都出自SpaceXAI自家評測,而掛在最前面的那項benchmark,由SpaceX上個月完成收購的Cursor維護。
為何價格不動比那些勝場更重要
採購代理式算力的人買的不是benchmark分數,而是長時間任務會以難以預估的速度吃掉的token。以2美元和6美元計,Grok 4.7低於GPT-5.6 Sol的4美元與20美元,更遠低於Fable 5.1的10美元與50美元。已經照Grok 4.6編好預算的團隊,等於零增量成本承接這次升級——在能力一跳、整層價格就跟著重訂的市場裡,這相當少見。
這也改變了輸掉那些項目的讀法。在Grok 4.7落後之處,問題不是這個模型有沒有跟上,而是那段差距值不值得多付五到八倍的token帳單。
七項benchmark一次看
SpaceXAI以xHigh強度跑Grok 4.7,對照Grok 4.6的High,以及GPT-5.6 Sol與Fable 5.1的Max。
| Benchmark | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
*為High強度下的分數。
直接計算,這是對Sol五勝、對Fable 5.1三勝,而且每一列都優於Grok 4.6。電機工程與法律兩項的差距懸殊到足以顯示,競爭對手根本沒有針對這些領域訓練。Terminal-Bench則完全相反:Fable 5.1的57.9%領先近二十個百分點,長達數小時的終端機作業,仍是多付錢確實買得到東西的最明顯場域。
SpaceXAI做了哪些調整
該公司把進步歸因於更大的基礎模型,以及一輪延長的強化學習,訓練重心偏向以小時而非分鐘計的任務。發表指出,自我驗證與長脈絡處理因此改善,模型也額外訓練成能原生操作Grok Bot harness。這個細節值得留意,因為決定代理在開放式任務中表現的,往往是對harness的熟悉度而非純粹的推理能力。
安全機制同步重建。SpaceXAI表示,模型在LatchBio的生物安全benchmark取得62.4%,在自家HackerBench v0.3上,危險雙用途提示的通過率為3.3%,並已開始開放受邀的資安夥伴使用模型的紅隊能力。
兩個要記住的但書
第一是來源。排在發表最前面的CursorBench 4.0,其維護者Cursor在上個月的收購後已是SpaceX子公司——自家benchmark佔據頭條位置,這個數字在流傳出去之前需要獨立複現。第二是取樣:本月稍早以高於Sol的價格推出的OpenAI GPT-6 Astra,只出現在次要圖表中,Grok 4.7在該處的1,695 Elo高於Astra的1,542,但落後Anthropic的1,735。
Grok 4.7已在Cursor與Grok Build上線,也可透過Grok API、第三方harness、路由服務與雲端平台取用。就像Grok 4.6發表那次一樣,真正的考驗不是發表當天的表格,而是接下來幾週中立評測機構量出來的數字。
FAQ・常見問題
Grok 4.7怎麼收費?
每百萬輸入token 2美元、每百萬輸出token 6美元,與Grok 4.6相同。另有輸出速度加倍的版本,價格也加倍。
Grok 4.7比Claude Fable 5.1好嗎?
視任務而定。Grok 4.7在DeepSWE v1.1、EEBench與Harvey法律benchmark領先;Fable 5.1在CursorBench 4.0、AA Briefcase、Terminal-Bench 4.0與HealthBench Professional領先,但輸入token單價貴上五倍。
Grok 4.7的benchmark結果有經過獨立驗證嗎?
沒有。所有公布分數都來自SpaceXAI自己的評測,CursorBench則由SpaceX上個月收購的Cursor維護,第三方結果尚未出爐。






