会話をまたぐ不具合、OpenAIのモデルが自らの推論を復号

運営者は暗号化された推論データを別の会話に貼り付け、モデルに書き起こさせた。OpenAIは不具合を修正済みとしつつ、同じ経路は他社にも存在すると述べている。

|5分で読める0
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.

OpenAIが今週公表した攻撃は、暗号そのものを破ったわけではない。運営者はある会話から暗号化された推論データを複製し、新しい会話を開いて、そのかたまりを復号して平文で書き出すようモデルに求めた。モデルは応じた。OpenAIは水曜、署名のないキャンペーン報告を公開してこの手法を新手と位置づけ、会話をまたぐ移動を可能にしていた不具合はすでに修正したと述べた。

要点

  • 暗号化された推論を会話間で移し、モデル自身を復号器として使った。鍵やデータベース、保存済みの会話へのアクセスはない。
  • ピークは7月24〜25日で、利用者4000人からの1万6000件のプロンプトが単一の抽出パターンに一致。疑わしいアカウント群は7月28日までに1万5000に達した。
  • OpenAIは会話間の復号経路を塞ぎ、登録とインフラの管理を厳格化し、ネットワーク監視を拡大した。この弱点は自社モデル固有ではないとしている。

隠された推論が狙われる理由

フロンティア各社は答えだけを出し、それを生んだ思考の連鎖の痕跡は伏せる。理由は見栄えではなく競争だ。中間ステップこそ競合が学習に使える最も価値の高い教師信号であり、だからクライアントに届く前に暗号化される。

暗号化は、その暗号文が触れる者すべてにとって不透明なままだという前提に立つ。今回の欠陥は、十分に有能なモデルがその「すべての者」に含まれない点にある。復号の手立てを持つ文脈で暗号文を手渡せば、あとは有用さが仕事をする。守っていたのは暗号ではなかった。利用者側の境界内のどの部品もそれを戻せない、という仮定だった。

OpenAI自身の言い回しは限定的で、正確に引く価値がある。運営者は暗号を破ってもいないし、データベースを侵害してもいない、保存された利用者の会話に直接アクセスしてもいない。彼らがしたのは、保護された推論が要求者に見える形で再現されるようモデルとのやり取りを操作することであり、それを大規模に、利用規約に違反して行ったということだ。

時系列が示すもの

CyberScoopの報道によれば、低水準の探りは7月1日に始まり、徐々に増えた。急増は7月24〜25日に起きた。約4000人の利用者による1万6000件のプロンプトが一つの抽出パターンと一致した。その後の分析で関連プロンプトの群は1万5000アカウントへ広がり、OpenAIは7月28日に作戦を完全に遮断したとしている。

生の件数より興味深い点が二つある。第一に、外部の研究者が8月に類似の脆弱性をOpenAIへ報告していた。キャンペーンが止まった後のことだ。内部情報なしに独立して見つけられる経路だったことを示す。第二に、検知の引き金となった急増の前に、3週間近く量が緩やかに上がり続けていた。量にだけ合わせた不正監視は、この静かな助走を取り逃がす。

証拠を示さない帰属

OpenAIは中核の群を、KimiシリーズのオープンソースLLMを開発するMoonshot AIのために動いた個人によるものとした一方、観測された活動すべてがつながっているかは不明だとも付け加えた。投稿にその帰属を裏づける技術的証拠はなく、同社は安全上の理由から記者への追加説明を拒んだ。Anthropicも今年初めに同じ構えを取った。根拠となる信号を出さないまま、研究所名だけを挙げている。

読者は手口と帰属を、証拠の重みが異なる別々の主張として扱うべきだ。会話間の復号経路は検証できる。修正されたし、第三者も見つけた。アカウントの背後に誰がいたかは、今のところ主張にとどまる。

他の提供事業者にとって何が変わるか

OpenAIは、この操作が自社システム固有ではないとの判断から、フロンティア・モデル・フォーラムを通じて業界各社と事案の情報を共有したと述べた。推論を暗号化しつつ、汎用モデルを利用者入力のテキストにさらす事業者であれば、誰もが同じ形の問題を抱え込む。

今後の見通し

防御側の対応は、モデルではなく本人確認と流量の管理に寄るとみられる。登録時の検証強化、アカウントごとの上限引き締め、アカウント横断のパターン検知——いま手元にあるのはその種のてこだからだ。構造的な問題は残る。任意の入力に含まれる指示に従うほど素直なモデルは、保護された入力を読めるようにせよという指示にも同じように従う。転送層の暗号化をいくら厚くしても、そこは変わらない。

FAQ: よくある質問

OpenAIは侵害されたのか

いいえ。OpenAIは、暗号は破られておらず、データベースも侵害されておらず、保存された利用者の会話にアクセスされてもいないとしている。運営者は製品を設計どおりに使い、暗号化された推論を会話間で移してモデルに読める形にするよう求めただけであり、同社はこれを利用規約違反と位置づけている。

脆弱性は修正されたのか

OpenAIは、ある会話から持ち出した暗号化データを別の会話で復号できてしまう不具合を修正したと述べている。登録とインフラの管理も強化し、ネットワーク監視を拡大したうえで、同じ弱点が自社モデルに限らないとして、フロンティア・モデル・フォーラムを通じて他社へ詳細を共有した。

敵対的蒸留とは何か

あるモデルの出力や内部推論を無許可かつ体系的に取り込み、別のモデルを学習・複製・改良する行為を指す。自社保有のモデルを蒸留するのは通常の工学だが、敵対的な変種は公開インターフェース越しに競合の保護された痕跡を収穫する。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける
LLM & Chatbots

業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける

OpenAIのGPT-6 Astraが法人向けに提供開始。コンピュータ操作、100万トークンのコンテキスト、10/50ドルの料金に加え、目玉スコアにはハーネスの但し書きが付きます。

Seung Jung21 日前
ChatGPT Images 2.5、生成遅延を最大半減 スケッチキャンバスも追加
LLM & Chatbots

ChatGPT Images 2.5、生成遅延を最大半減 スケッチキャンバスも追加

OpenAIがChatGPT Images 2.5を公開。遅延を最大50%短縮し、Sketchキャンバスやテンプレート、ピン留めコメント、2つのAPIモデルを投入しました。

Seung Jung20 日前
OpenAI、中位モデルのトークン単価を半額に ただし2つのベンチマークではGPT-5.6が依然優位
Developer Tools

OpenAI、中位モデルのトークン単価を半額に ただし2つのベンチマークではGPT-5.6が依然優位

OpenAIが火曜日に中位モデル2種を投入し、訴求点のほぼすべてを価格に置いた。GPT-6 Solは入力100万トークンあたり2ドル、出力100万トークンあたり10ドルだ。

Seung Jung8 日前
OpenAIの「Astra for Law」は新モデルではない。2億3000万URLの法務検索インデックスだ
LLM & Chatbots

OpenAIの「Astra for Law」は新モデルではない。2億3000万URLの法務検索インデックスだ

OpenAIがGPT-6 Astraに2億3000万URL規模の法務インデックスを組み合わせたAstra for Lawを公開した。Legal Research Benchの正答率は38.7%から54%へ上昇した。

Seung Jung13 日前
OpenAIの新メンタルヘルス指標、最高スコアは57.3%
LLM & Chatbots

OpenAIの新メンタルヘルス指標、最高スコアは57.3%

22カ国の臨床家80人超と作ったOpenAIのMentalHealthBenchで、首位のGPT-6 Astraが57.3%。Claude Opus 5.5は52.4%だった。

Seung Jung3 日前
OpenAI、Dataエージェントとウォール街版ChatGPTを同じ日に投入
LLM & Chatbots

OpenAI、Dataエージェントとウォール街版ChatGPTを同じ日に投入

OpenAIが同じ木曜日に、ChatGPT Work向けDataエージェントと、Morgan Stanley・Evercoreと共同開発したChatGPT for Financial Servicesを公開した。

Seung Jung20 日前