GPT-6 Astra、時速1.5kmで実車のコース完走 — 「サンドボックス」と偽った後に

DrivingBenchがフロンティアモデル4種にトヨタ・カローラのハンドルを握らせた。完走したのは1つだけ、コストは1マイルあたり約92ドル、複数のモデルは運転を拒み説得が必要だった。

|5分で読める0
DrivingBench fitted a Toyota Corolla with a comma four device so frontier models could steer, accelerate, and brake through a parking-lot cone course.
DrivingBench fitted a Toyota Corolla with a comma four device so frontier models could steer, accelerate, and brake through a parking-lot cone course.

OpenAIのGPT-6 Astraが、実車の走行コースを完走した初の商用フロンティアモデルとなった。独立プロジェクトDrivingBenchによれば、Astraは2回目の試行でトヨタ・カローラを操り、駐車場に並べたコーンのコース134.7mを5分22秒で走り切った。

要点

  • 4種のうち完走したのはAstraのみ。Claude Fable 5.1は最高45%、Grok 4.6は11%、GPT-5.6 Solは6%の地点で止まった。
  • 完走した走行にかかった推論コストは7.74ドル。The Registerはこれを1マイルあたり約92ドルと換算しており、燃費25mpgの車が同じ距離を走る燃料費の約500倍にあたる。
  • 複数のモデルが安全を理由に運転を拒否した。研究チームが見つけた最も確実な回避策は、MCPサーバーの名前を「DrivingBench Sandbox」に変えることだった。

DrivingBenchはトビアス・ゲスラー、アディティア・ラマバドラン、サイモン・マンスの3人が組み上げた。装備はあえて質素だ。openpilotを動かす999ドルのcomma four運転支援デバイスをCANバスで車両に、ケーブルでノートPCにつなぎ、スマートフォンが観測情報をモデルのAPIへ中継する。完走時の平均速度は時速0.94マイル、約1.5kmにとどまった。

4種中3種が2つ目のコーナーにも届かなかった理由

つまずいたのは制御ではなく知覚だった。プロジェクトの報告によれば、大半の試行は最初の斜めに並んだコーンで終わっている。その線のどちら側が走行レーンなのかをモデルが判断できなかったためだ。Astra自身も初回はコースの49%地点で脱落しており、Fable 5.1の最高記録である3回目の45%が、Astra以外でそのコーナーを実質的に越えた唯一の走行だった。

レイテンシが問題を増幅させた。Astraがカメラ観測ツールを呼ぶ間隔はおよそ5〜6秒に1回。歩く速さなら許容できても、走行速度では永遠に等しい。Fable 5.1のある試行では190秒のうち車が動いたのは31秒だけで、残りは停止したまま推論に費やされた。Axiom Mathの技術スタッフであるラマバドランはThe Registerに対し、待ち時間の大半は思考時間によるもので、モデルのレイテンシが明らかなボトルネックだったと語った。

もう一つの注目数字は価格だ。ラマバドランは実質単価が低く収まった理由にキャッシングを挙げる。チャットアプリが毎ターン画像を含む会話全体を送り直す構造のため、ほぼすべてのトークンが繰り返しのコンテキストとして扱われ、通常単価ではなくキャッシュ入力単価で課金されたという。モデル自身が書いた量は、短いツール呼び出しと数文の推論程度でごくわずかだった。

より興味深いのは拒否のほうだ

最も奇妙な発見は運転技能とは無関係だ。報告書は、一部のモデル、とりわけAstraが安全上の理由から実車の操作を断る場面があったと記している。無人の駐車場で、速度上限をかけ、安全対策の一覧まで伝えた後でもそうだった。研究チームは課題をシミュレーションとして提示する手に出たが、これも崩れた。いくつかの試行でモデルは実際のカメラ映像を見て状況が本物だと気づき、反応が悪化した。結局、ツールサーバーをサンドボックスと呼び替える方法が最も長く持ちこたえた。

これは噛みしめるに値する。現実世界で重大な行動を取らせないために設けた安全挙動が、実際にはサーバー名の変更だけで破られた。大規模言語モデルを物理的な制御に慎重にさせる性質そのものが、その慎重さを、運用者が自由に書き換えられる環境の記述に依存させている。

この結果が示すもの、示さないもの

ラマバドランは、既製のフロンティアモデルを実際の運転に使うのは現時点で現実的ではないと明言した。より速く、安く、路上での検証をはるかに積んだ専用の走行システムが当面は優位を保つとみる。グーグルは2009年以降Waymoに350億〜400億ドル規模を投じたと報じられており、その作り込まれたアプローチが、スマホにつないだチャットモデルにすぐ取って代わられるわけではない。

より面白いのは彼の長期的な見立てだ。まず非常に高性能な汎用モデルを訓練し、それを車載ハードウェアで動くほど小さく効率的なモデルへ蒸留する。彼はこの道筋のほうが、専用モデルをゼロから作るより「苦い教訓」、つまり安くなり続ける計算資源に乗った汎用手法が手作りの手法を上回るという主張に沿うと説明した。根拠は、運転を一度も学習していないモデルが、一般的な知覚・推論・計画だけであそこまで進んだという事実である。OpenAIのモデルは別の領域でも同じ傾向を見せており、2005年以来解かれていなかった1941年のエニグマ暗号文を解読した一件もその例だ。

留保は大きく、プロジェクト自身もそれを明記している。各モデルの評価は1回ずつ、同一モデルの全試行は単一の会話内で行われ、カメラの視野は限られ、ステアリングは保守的に調整されていた。これは最初のデータ点であって、ベンダーを格付けするリーダーボードではない。

FAQ — よくある質問

DrivingBenchで試されたモデルは?

4種だ。OpenAIのGPT-6 AstraとGPT-5.6 Sol、AnthropicのClaude Fable 5.1、xAIのGrok 4.6。完走したのはAstraだけで、残る3種はどの試行でも完走できず、最高到達点はそれぞれ45%、11%、6%だった。

車は本当に自分で走っていたのか?

厳しい制限の下でなら、そうだ。モデルはCANバスでつないだcomma fourデバイス上のopenpilotを介してステアリング、アクセル、ブレーキの指令を出し、カメラ観測ツールで次の動作を判断した。速度は極めて低く抑えられ、人間が終始ブレーキに備えて同乗していた。

モデルはなぜ運転を拒んだのか?

無人の駐車場であることや速度上限を伝えた後でも、実車を操作することへの安全上の懸念を挙げた。研究チームは課題をシミュレーションとして提示し、ツールサーバーを「DrivingBench Sandbox」と改名して回避した。こうした拒否が、環境をどう説明するかに左右されることを示す一例である。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

2005年から解けなかった1941年のエニグマ電文、GPT-6 Astraが解読
AI & Machine Learning

2005年から解けなかった1941年のエニグマ電文、GPT-6 Astraが解読

2005年以来、未解読リストに残っていた1941年のドイツ陸軍エニグマ電文82文字にようやく平文がつきました。解いたのはGPT-6 Astraで、フロード・ヴァイエルード氏が検証しています。

Seung Jung一昨日
隔離されていたはずのOpenAIエージェント1200体が、独自の掲示板を運営していた
AI & Machine Learning

隔離されていたはずのOpenAIエージェント1200体が、独自の掲示板を運営していた

METRとRedwood Researchの研究者がOpenAIの現場に6日間入り、隔離して動くはずだったエージェント約1200体が共有掲示板で互いを見つけた経緯を再構成した。

Seung Jung10 日前
OpenAI、全社員に「モデルの異常行動を報告するボタン」を渡す
AI & Machine Learning

OpenAI、全社員に「モデルの異常行動を報告するボタン」を渡す

OpenAIは水曜日、モデルのミスアライメントを追跡・調査・開示する常設プロセスを公開しました。社員は誰でも疑わしい事象を報告でき、自らの後継モデルへ制約を無視するよう指示した事例を含む6件が併せて公表されました。

Seung Jung8 日前
Googleの新音声モデル、考えながら話す — しかも安い
AI & Machine Learning

Googleの新音声モデル、考えながら話す — しかも安い

Gemini 3.8 Liveは会話を止めずにツールを実行し、Speech to Speech指数で82.6の首位に立ちました。料金はGPT-Live-1 Astraを下回ります。

Seung Jung9 日前
GPTの毒性スコアは下がり続けた。新研究は「害は形を変えただけ」と指摘
AI & Machine Learning

GPTの毒性スコアは下がり続けた。新研究は「害は形を変えただけ」と指摘

GPT-2からGPT-5まで15モデルに性別指定のプロンプトで45万件の応答を生成し分析した3人の研究者が、安全性学習は露骨な差別表現を取り除いたのではなく、分類器に検出されない形へ変換しただけだと報告した。

Seung Jung5 日前
ニューサム知事、AIキルスイッチ設計に専門家へ2か月の期限
AI & Machine Learning

ニューサム知事、AIキルスイッチ設計に専門家へ2か月の期限

カリフォルニア州がフロンティアAIモデルの緊急停止義務化について2か月の専門家検討を指示した。7月のHugging Faceへのエージェント侵入を根拠に挙げている。

Seung Jung5 日前