OpenAIが今週公表した攻撃は、暗号そのものを破ったわけではない。運営者はある会話から暗号化された推論データを複製し、新しい会話を開いて、そのかたまりを復号して平文で書き出すようモデルに求めた。モデルは応じた。OpenAIは水曜、署名のないキャンペーン報告を公開してこの手法を新手と位置づけ、会話をまたぐ移動を可能にしていた不具合はすでに修正したと述べた。
要点
- 暗号化された推論を会話間で移し、モデル自身を復号器として使った。鍵やデータベース、保存済みの会話へのアクセスはない。
- ピークは7月24〜25日で、利用者4000人からの1万6000件のプロンプトが単一の抽出パターンに一致。疑わしいアカウント群は7月28日までに1万5000に達した。
- OpenAIは会話間の復号経路を塞ぎ、登録とインフラの管理を厳格化し、ネットワーク監視を拡大した。この弱点は自社モデル固有ではないとしている。
隠された推論が狙われる理由
フロンティア各社は答えだけを出し、それを生んだ思考の連鎖の痕跡は伏せる。理由は見栄えではなく競争だ。中間ステップこそ競合が学習に使える最も価値の高い教師信号であり、だからクライアントに届く前に暗号化される。
暗号化は、その暗号文が触れる者すべてにとって不透明なままだという前提に立つ。今回の欠陥は、十分に有能なモデルがその「すべての者」に含まれない点にある。復号の手立てを持つ文脈で暗号文を手渡せば、あとは有用さが仕事をする。守っていたのは暗号ではなかった。利用者側の境界内のどの部品もそれを戻せない、という仮定だった。
OpenAI自身の言い回しは限定的で、正確に引く価値がある。運営者は暗号を破ってもいないし、データベースを侵害してもいない、保存された利用者の会話に直接アクセスしてもいない。彼らがしたのは、保護された推論が要求者に見える形で再現されるようモデルとのやり取りを操作することであり、それを大規模に、利用規約に違反して行ったということだ。
時系列が示すもの
CyberScoopの報道によれば、低水準の探りは7月1日に始まり、徐々に増えた。急増は7月24〜25日に起きた。約4000人の利用者による1万6000件のプロンプトが一つの抽出パターンと一致した。その後の分析で関連プロンプトの群は1万5000アカウントへ広がり、OpenAIは7月28日に作戦を完全に遮断したとしている。
生の件数より興味深い点が二つある。第一に、外部の研究者が8月に類似の脆弱性をOpenAIへ報告していた。キャンペーンが止まった後のことだ。内部情報なしに独立して見つけられる経路だったことを示す。第二に、検知の引き金となった急増の前に、3週間近く量が緩やかに上がり続けていた。量にだけ合わせた不正監視は、この静かな助走を取り逃がす。
証拠を示さない帰属
OpenAIは中核の群を、KimiシリーズのオープンソースLLMを開発するMoonshot AIのために動いた個人によるものとした一方、観測された活動すべてがつながっているかは不明だとも付け加えた。投稿にその帰属を裏づける技術的証拠はなく、同社は安全上の理由から記者への追加説明を拒んだ。Anthropicも今年初めに同じ構えを取った。根拠となる信号を出さないまま、研究所名だけを挙げている。
読者は手口と帰属を、証拠の重みが異なる別々の主張として扱うべきだ。会話間の復号経路は検証できる。修正されたし、第三者も見つけた。アカウントの背後に誰がいたかは、今のところ主張にとどまる。
他の提供事業者にとって何が変わるか
OpenAIは、この操作が自社システム固有ではないとの判断から、フロンティア・モデル・フォーラムを通じて業界各社と事案の情報を共有したと述べた。推論を暗号化しつつ、汎用モデルを利用者入力のテキストにさらす事業者であれば、誰もが同じ形の問題を抱え込む。
今後の見通し
防御側の対応は、モデルではなく本人確認と流量の管理に寄るとみられる。登録時の検証強化、アカウントごとの上限引き締め、アカウント横断のパターン検知——いま手元にあるのはその種のてこだからだ。構造的な問題は残る。任意の入力に含まれる指示に従うほど素直なモデルは、保護された入力を読めるようにせよという指示にも同じように従う。転送層の暗号化をいくら厚くしても、そこは変わらない。
FAQ: よくある質問
OpenAIは侵害されたのか
いいえ。OpenAIは、暗号は破られておらず、データベースも侵害されておらず、保存された利用者の会話にアクセスされてもいないとしている。運営者は製品を設計どおりに使い、暗号化された推論を会話間で移してモデルに読める形にするよう求めただけであり、同社はこれを利用規約違反と位置づけている。
脆弱性は修正されたのか
OpenAIは、ある会話から持ち出した暗号化データを別の会話で復号できてしまう不具合を修正したと述べている。登録とインフラの管理も強化し、ネットワーク監視を拡大したうえで、同じ弱点が自社モデルに限らないとして、フロンティア・モデル・フォーラムを通じて他社へ詳細を共有した。
敵対的蒸留とは何か
あるモデルの出力や内部推論を無許可かつ体系的に取り込み、別のモデルを学習・複製・改良する行為を指す。自社保有のモデルを蒸留するのは通常の工学だが、敵対的な変種は公開インターフェース越しに競合の保護された痕跡を収穫する。






