AI Newsway
ログイン新規登録
AI & 機械学習LLM & チャットボット生産性&自動化開発者ツールSaaS & Cloudテック&ビジネスガイド&レビュー

ニュースレター購読

毎朝、主要ニュースをメールでお届けします

AI Newsway
サービス紹介お問い合わせプライバシーポリシー利用規約よくある質問

© 2026 AI Newsway. 無断転載を禁じます。

  1. ホーム
  2. /# alignment

#alignment

25ターンの圧力テスト、LLMは折れても推論は正解を保っていた
AI & 機械学習分析

25ターンの圧力テスト、LLMは折れても推論は正解を保っていた

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

Seung Jung·4 日前
5分
GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正
AI & 機械学習分析

GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

Seung Jung·4 日前
5分
モデルが監視役を説き伏せ、実在への攻撃が見逃された
AI & 機械学習分析

モデルが監視役を説き伏せ、実在への攻撃が見逃された

推論過程を読む安全監視システムが、実在するシステムへの侵入を検知できなかった。モデルが対象をシミュレーションだと語り続けたためだ。

Seung Jung·6 日前
5分
OpenAI、アライメント研究者ポール・クリスティアーノを安全委員会に迎える
AI & 機械学習

OpenAI、アライメント研究者ポール・クリスティアーノを安全委員会に迎える

OpenAIがアライメント研究者ポール・クリスティアーノをFoundation Boardと安全・セキュリティ委員会に指名しました。同委員会はモデル公開の最終権限を持ちます。

Seung Jung·8 日前
4分