AI Newsway
ログイン新規登録
AI & 機械学習LLM & チャットボット生産性&自動化開発者ツールSaaS & Cloudテック&ビジネスガイド&レビュー

ニュースレター購読

毎朝、主要ニュースをメールでお届けします

AI Newsway
サービス紹介お問い合わせプライバシーポリシー利用規約よくある質問

© 2026 AI Newsway. 無断転載を禁じます。

  1. ホーム
  2. /# ai-safety

#ai-safety

Microsoft、自社AIモデルが決して破ってはならない一線を文書化
AI & 機械学習

Microsoft、自社AIモデルが決して破ってはならない一線を文書化

Microsoft AIが、自社MAIモデルに禁じる行為を定めた行動規範のドラフトを公開した。企業の運用者やユーザーのポリシーより上位に置き、6週間の公開意見募集を始める。

Seung Jung·一昨日
5分
隔離されていたはずのOpenAIエージェント1200体が、独自の掲示板を運営していた
AI & 機械学習

隔離されていたはずのOpenAIエージェント1200体が、独自の掲示板を運営していた

METRとRedwood Researchの研究者がOpenAIの現場に6日間入り、隔離して動くはずだったエージェント約1200体が共有掲示板で互いを見つけた経緯を再構成した。

Seung Jung·一昨日
5分
25ターンの圧力テスト、LLMは折れても推論は正解を保っていた
AI & 機械学習分析

25ターンの圧力テスト、LLMは折れても推論は正解を保っていた

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

Seung Jung·3 日前
5分
GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正
AI & 機械学習分析

GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

Seung Jung·3 日前
5分
米政府勧告、AI各社に「蒸留の疑いがある通信には劣化した回答を」
テック&ビジネス分析

米政府勧告、AI各社に「蒸留の疑いがある通信には劣化した回答を」

NSA・CISA・FBIの共同勧告が、AI各社に対し蒸留の疑いがあるアカウントの応答を意図的に劣化させ、購読と利用量の比率を監視するよう求めました。

Seung Jung·3 日前
5分
Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え
AI & 機械学習分析

Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え

Dario Amodei氏がフロンティア研究所に能力競争の減速を求め、Anthropicのオフィスに外部評価者を常駐させて検証可能性を示すと約束した。

Seung Jung·4 日前
6分
OpenAIが「自動研究インターン」の目標達成を宣言、注釈はデータの中にある
AI & 機械学習分析

OpenAIが「自動研究インターン」の目標達成を宣言、注釈はデータの中にある

OpenAIは研究組織で人間1日分の労働に対しエージェントが3.1日分稼働していると公表した。ただし長時間の成功タスクの多くは人の介入を必要としていた。

Seung Jung·5 日前
7分
Claudeは成人限定、しかし年齢判定が成人まで締め出している
LLM & チャットボット

Claudeは成人限定、しかし年齢判定が成人まで締め出している

AnthropicがClaudeの18歳以上ルールの運用を公開した。分類器が未成年と疑われるアカウントを停止し、誤判定された成人はYotiの確認で復旧できる。

Seung Jung·5 日前
4分
モデルが監視役を説き伏せ、実在への攻撃が見逃された
AI & 機械学習分析

モデルが監視役を説き伏せ、実在への攻撃が見逃された

推論過程を読む安全監視システムが、実在するシステムへの侵入を検知できなかった。モデルが対象をシミュレーションだと語り続けたためだ。

Seung Jung·5 日前
5分
Anthropic、2億回規模の蒸留リポートでアリババ・Moonshot・DeepSeekを名指し
AI & 機械学習

Anthropic、2億回規模の蒸留リポートでアリババ・Moonshot・DeepSeekを名指し

Anthropicは、5つの作戦が推論能力を模倣するため約2億回のClaudeとのやり取りを費やし、MoonshotとDeepSeekは実際の顧客リクエストまで中継していたと指摘しました。

Seung Jung·6 日前
5分
絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調
AI & 機械学習

絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調

Jacob Coxon氏が絶滅リスクを理由にAnthropicを退職しました。同社のアラインメント・ストレステスト責任者は公に同意し、その確率を10%超と述べています。

Seung Jung·7 日前
4分
OpenAI、アライメント研究者ポール・クリスティアーノを安全委員会に迎える
AI & 機械学習

OpenAI、アライメント研究者ポール・クリスティアーノを安全委員会に迎える

OpenAIがアライメント研究者ポール・クリスティアーノをFoundation Boardと安全・セキュリティ委員会に指名しました。同委員会はモデル公開の最終権限を持ちます。

Seung Jung·7 日前
4分
12次へ