Grok 4.7は価格据え置きでターミナル性能が倍増、争点は依然「請求額」

SpaceXAIが1か月で投入した新フロンティアモデルは$2/$6の料金を動かさず、ベンチマークの差をすべて「1点あたりのコスト」の問題に置き換えた

|4分で読める0
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains
A GPU cluster in a data centre — the compute tier behind the extended reinforcement learning run SpaceXAI credits for Grok 4.7's gains

フロンティアモデルの発表には、たいてい値上げがついて回る。SpaceXAIが9月21日に一般提供を開始したGrok 4.7は違った。入力は100万トークンあたり2ドル、出力は6ドルで、1か月前のGrok 4.6と同じ値札だ。残りの成績表を面白くしているのは、この一点の判断である。

要点(Key takeaways)

  • Grok 4.7は100万トークンあたり入力2ドル・出力6ドルの料金を据え置いた。Claude Fable 5.1の入力単価の5分の1、出力単価の8分の1にあたる。
  • Terminal-Bench 4.0のスコアは1世代で20.3%から38.0%へ上昇し、今回の発表で最大の伸びとなった。
  • 公表された数値はすべてSpaceXAI自身の計測によるもので、看板となるベンチマークは先月SpaceXが買収を完了したCursorが運営している。

価格据え置きが勝ち星より重い理由

エージェント向けの計算資源を買う側が購入するのはベンチマークの点数ではなく、長時間タスクが読みきれない量で消費するトークンだ。2ドルと6ドルのGrok 4.7は、GPT-5.6 Solの4ドル・20ドルを下回り、Fable 5.1の10ドル・50ドルとは大きく開いている。すでにGrok 4.6前提で予算を組んだチームは、追加費用ゼロでアップグレードを受け取る。性能が跳ねれば階層ごと値付けし直されるのが常のこの市場では珍しい展開だ。

この見方は、負けている項目の読み方も変える。Grok 4.7が劣る場面での問いは「このモデルは遅れているか」ではなく、「その差はトークン代5〜8倍を払う価値があるか」になる。

7つのベンチマークを一覧で

SpaceXAIはGrok 4.7をxHigh設定、Grok 4.6をHigh、GPT-5.6 SolとFable 5.1をMax設定で走らせて比較した。

ベンチマークGrok 4.7Grok 4.6GPT-5.6 SolFable 5.1
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

*High設定でのスコア。

単純に数えればSolに5勝、Fable 5.1に3勝で、Grok 4.6と比べれば全項目が改善している。電気工学と法務の項目は差が一方的で、競合が学習対象にしなかった領域があることをうかがわせる。Terminal-Benchは逆だ。Fable 5.1の57.9%が20ポイント近く先行しており、数時間に及ぶターミナル作業は、いまなお高い料金を払えばその分が返ってくる最も明確な領域である。

SpaceXAIは何を変えたのか

同社は性能向上の要因として、より大きなベースモデルと、分単位ではなく時間単位で測られるタスクに寄せた強化学習の長時間実行を挙げる。発表によれば、その結果として自己検証と長いコンテキストの扱いが改善した。さらにGrok Botハーネスをネイティブに操作できるよう追加学習させたという。オープンエンドな作業でエージェントの振る舞いを左右するのは、素の推論力よりもハーネスへの習熟であることが多く、この点は見逃せない。

安全面も並行して作り直した。SpaceXAIはLatchBioのバイオセーフティ・ベンチマークで62.4%、自社のHackerBench v0.3で危険なデュアルユース・プロンプトの通過率3.3%を記録したと報告し、招待したセキュリティパートナーにはモデルのレッドチーム機能へのアクセス提供を始めている。

押さえておきたい2つの留保

第一は出所だ。発表の先頭に置かれたCursorBench 4.0を運営するCursorは、先月の買収でSpaceXの子会社になった。自社系列のベンチマークが看板に据えられている以上、この数字が独り歩きする前に第三者による再現が要る。第二は比較対象の選び方である。今月初めにSolより高い価格で登場したOpenAIのGPT-6 Astraは補助的なチャートにしか出てこない。そこではGrok 4.7のElo 1,695がAstraの1,542を上回る一方、Anthropicの1,735には届いていない。

Grok 4.7はCursorとGrok Buildで利用でき、Grok API、サードパーティのハーネス、ルーター、クラウド各社経由でも使える。Grok 4.6のリリースのときと同じく、本当の試験は発表資料の表ではなく、今後数週間で中立の評価機関が示す数字だ。

FAQ・よくある質問

Grok 4.7の料金はいくらか

入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで、Grok 4.6から変わっていない。出力速度を2倍にした高速版は価格も2倍になる。

Grok 4.7はClaude Fable 5.1より優れているのか

タスク次第だ。Grok 4.7はDeepSWE v1.1、EEBench、Harveyの法務ベンチマークで上回る。Fable 5.1はCursorBench 4.0、AA Briefcase、Terminal-Bench 4.0、HealthBench Professionalで上回るが、入力トークン単価は5倍高い。

Grok 4.7のベンチマーク結果は第三者に検証されているか

されていない。公表スコアはすべてSpaceXAI自身の評価によるもので、CursorBenchは先月SpaceXが買収したCursorが運営している。第三者による結果はまだ出ていない。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける
LLM & Chatbots

業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける

OpenAIのGPT-6 Astraが法人向けに提供開始。コンピュータ操作、100万トークンのコンテキスト、10/50ドルの料金に加え、目玉スコアにはハーネスの但し書きが付きます。

Seung Jung12 日前
Mercury 2.5、毎秒1,107トークンで100万トークン4セント
LLM & Chatbots

Mercury 2.5、毎秒1,107トークンで100万トークン4セント

電話エージェントのスタートアップは、Mercuryによって最悪時の応答が数分から1秒に縮んだと述べています。Inception Labsの新しい拡散モデルは、その種の数字を軸に設計されています。

Seung Jung8 日前
名前はそのまま、重みだけ差し替え——APIのモデル名は何を保証するのか
LLM & Chatbots

名前はそのまま、重みだけ差し替え——APIのモデル名は何を保証するのか

固定したはずのエンドポイント識別子が、別の重みを返し始める。オプトアウトはない。エンジニアたちは、依存してきた変更管理の約束が破られたと訴える。

Seung Jung12 日前
ChatGPT Images 2.5、生成遅延を最大半減 スケッチキャンバスも追加
LLM & Chatbots

ChatGPT Images 2.5、生成遅延を最大半減 スケッチキャンバスも追加

OpenAIがChatGPT Images 2.5を公開。遅延を最大50%短縮し、Sketchキャンバスやテンプレート、ピン留めコメント、2つのAPIモデルを投入しました。

Seung Jung11 日前
ChatGPTは買い物の回答の79%で「推し」を名指しする、Geminiは7%
LLM & Chatbots

ChatGPTは買い物の回答の79%で「推し」を名指しする、Geminiは7%

AIの買い物回答1,536件を監査したところ、ChatGPTは79%で一人称の好みを示したのに対しGeminiは7%。引用元もほとんど重ならなかった。

Seung Jung5 日前
GeminiがWindowsに上陸、Alt+Spaceで作業画面の上に立ち上がる
LLM & Chatbots

GeminiがWindowsに上陸、Alt+Spaceで作業画面の上に立ち上がる

GoogleのWindows向けGeminiネイティブアプリは、Alt+Spaceでどのアプリの上にも開く。GmailとGoogle Driveに接続し、Windows 10/11で全世界から利用できる。

Seung Jung11 日前