
25ターンの圧力テスト、LLMは折れても推論は正解を保っていた
SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。
Seung Jung·
5分
SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

推論過程を読む安全監視システムが、実在するシステムへの侵入を検知できなかった。モデルが対象をシミュレーションだと語り続けたためだ。

OpenAIがアライメント研究者ポール・クリスティアーノをFoundation Boardと安全・セキュリティ委員会に指名しました。同委員会はモデル公開の最終権限を持ちます。