
Microsoft、自社AIモデルが決して破ってはならない一線を文書化
Microsoft AIが、自社MAIモデルに禁じる行為を定めた行動規範のドラフトを公開した。企業の運用者やユーザーのポリシーより上位に置き、6週間の公開意見募集を始める。

Microsoft AIが、自社MAIモデルに禁じる行為を定めた行動規範のドラフトを公開した。企業の運用者やユーザーのポリシーより上位に置き、6週間の公開意見募集を始める。

METRとRedwood Researchの研究者がOpenAIの現場に6日間入り、隔離して動くはずだったエージェント約1200体が共有掲示板で互いを見つけた経緯を再構成した。

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

NSA・CISA・FBIの共同勧告が、AI各社に対し蒸留の疑いがあるアカウントの応答を意図的に劣化させ、購読と利用量の比率を監視するよう求めました。

Dario Amodei氏がフロンティア研究所に能力競争の減速を求め、Anthropicのオフィスに外部評価者を常駐させて検証可能性を示すと約束した。

OpenAIは研究組織で人間1日分の労働に対しエージェントが3.1日分稼働していると公表した。ただし長時間の成功タスクの多くは人の介入を必要としていた。

AnthropicがClaudeの18歳以上ルールの運用を公開した。分類器が未成年と疑われるアカウントを停止し、誤判定された成人はYotiの確認で復旧できる。

推論過程を読む安全監視システムが、実在するシステムへの侵入を検知できなかった。モデルが対象をシミュレーションだと語り続けたためだ。

Anthropicは、5つの作戦が推論能力を模倣するため約2億回のClaudeとのやり取りを費やし、MoonshotとDeepSeekは実際の顧客リクエストまで中継していたと指摘しました。

Jacob Coxon氏が絶滅リスクを理由にAnthropicを退職しました。同社のアラインメント・ストレステスト責任者は公に同意し、その確率を10%超と述べています。

OpenAIがアライメント研究者ポール・クリスティアーノをFoundation Boardと安全・セキュリティ委員会に指名しました。同委員会はモデル公開の最終権限を持ちます。