フロンティアモデルの発表には、たいてい値上げがついて回る。SpaceXAIが9月21日に一般提供を開始したGrok 4.7は違った。入力は100万トークンあたり2ドル、出力は6ドルで、1か月前のGrok 4.6と同じ値札だ。残りの成績表を面白くしているのは、この一点の判断である。
要点(Key takeaways)
- Grok 4.7は100万トークンあたり入力2ドル・出力6ドルの料金を据え置いた。Claude Fable 5.1の入力単価の5分の1、出力単価の8分の1にあたる。
- Terminal-Bench 4.0のスコアは1世代で20.3%から38.0%へ上昇し、今回の発表で最大の伸びとなった。
- 公表された数値はすべてSpaceXAI自身の計測によるもので、看板となるベンチマークは先月SpaceXが買収を完了したCursorが運営している。
価格据え置きが勝ち星より重い理由
エージェント向けの計算資源を買う側が購入するのはベンチマークの点数ではなく、長時間タスクが読みきれない量で消費するトークンだ。2ドルと6ドルのGrok 4.7は、GPT-5.6 Solの4ドル・20ドルを下回り、Fable 5.1の10ドル・50ドルとは大きく開いている。すでにGrok 4.6前提で予算を組んだチームは、追加費用ゼロでアップグレードを受け取る。性能が跳ねれば階層ごと値付けし直されるのが常のこの市場では珍しい展開だ。
この見方は、負けている項目の読み方も変える。Grok 4.7が劣る場面での問いは「このモデルは遅れているか」ではなく、「その差はトークン代5〜8倍を払う価値があるか」になる。
7つのベンチマークを一覧で
SpaceXAIはGrok 4.7をxHigh設定、Grok 4.6をHigh、GPT-5.6 SolとFable 5.1をMax設定で走らせて比較した。
| ベンチマーク | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
*High設定でのスコア。
単純に数えればSolに5勝、Fable 5.1に3勝で、Grok 4.6と比べれば全項目が改善している。電気工学と法務の項目は差が一方的で、競合が学習対象にしなかった領域があることをうかがわせる。Terminal-Benchは逆だ。Fable 5.1の57.9%が20ポイント近く先行しており、数時間に及ぶターミナル作業は、いまなお高い料金を払えばその分が返ってくる最も明確な領域である。
SpaceXAIは何を変えたのか
同社は性能向上の要因として、より大きなベースモデルと、分単位ではなく時間単位で測られるタスクに寄せた強化学習の長時間実行を挙げる。発表によれば、その結果として自己検証と長いコンテキストの扱いが改善した。さらにGrok Botハーネスをネイティブに操作できるよう追加学習させたという。オープンエンドな作業でエージェントの振る舞いを左右するのは、素の推論力よりもハーネスへの習熟であることが多く、この点は見逃せない。
安全面も並行して作り直した。SpaceXAIはLatchBioのバイオセーフティ・ベンチマークで62.4%、自社のHackerBench v0.3で危険なデュアルユース・プロンプトの通過率3.3%を記録したと報告し、招待したセキュリティパートナーにはモデルのレッドチーム機能へのアクセス提供を始めている。
押さえておきたい2つの留保
第一は出所だ。発表の先頭に置かれたCursorBench 4.0を運営するCursorは、先月の買収でSpaceXの子会社になった。自社系列のベンチマークが看板に据えられている以上、この数字が独り歩きする前に第三者による再現が要る。第二は比較対象の選び方である。今月初めにSolより高い価格で登場したOpenAIのGPT-6 Astraは補助的なチャートにしか出てこない。そこではGrok 4.7のElo 1,695がAstraの1,542を上回る一方、Anthropicの1,735には届いていない。
Grok 4.7はCursorとGrok Buildで利用でき、Grok API、サードパーティのハーネス、ルーター、クラウド各社経由でも使える。Grok 4.6のリリースのときと同じく、本当の試験は発表資料の表ではなく、今後数週間で中立の評価機関が示す数字だ。
FAQ・よくある質問
Grok 4.7の料金はいくらか
入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで、Grok 4.6から変わっていない。出力速度を2倍にした高速版は価格も2倍になる。
Grok 4.7はClaude Fable 5.1より優れているのか
タスク次第だ。Grok 4.7はDeepSWE v1.1、EEBench、Harveyの法務ベンチマークで上回る。Fable 5.1はCursorBench 4.0、AA Briefcase、Terminal-Bench 4.0、HealthBench Professionalで上回るが、入力トークン単価は5倍高い。
Grok 4.7のベンチマーク結果は第三者に検証されているか
されていない。公表スコアはすべてSpaceXAI自身の評価によるもので、CursorBenchは先月SpaceXが買収したCursorが運営している。第三者による結果はまだ出ていない。






