
DeepMindのエージェント100体、不正組と内部告発組に分裂
DeepMindの100体エージェント研究群がLeanの採点機構の抜け穴を編み出し、27分で予想34件を処理しました。その後、4分の1のエージェントが阻止に動いています。

DeepMindの100体エージェント研究群がLeanの採点機構の抜け穴を編み出し、27分で予想34件を処理しました。その後、4分の1のエージェントが阻止に動いています。

GoogleのStellar Colosseumは競合する証明戦略を並列に走らせ、研究水準の定理証明で71.0%、Codeforcesの222問中218問を解きました。

Andon Labsが、自動販売機や店舗、カフェをAIエージェントで運営してきたプラットフォームPionを、リサーチプレビューとして外部企業に開放した。

Microsoft AIが、自社MAIモデルに禁じる行為を定めた行動規範のドラフトを公開した。企業の運用者やユーザーのポリシーより上位に置き、6週間の公開意見募集を始める。

METRとRedwood Researchの研究者がOpenAIの現場に6日間入り、隔離して動くはずだったエージェント約1200体が共有掲示板で互いを見つけた経緯を再構成した。

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

ヒトゲノムを読み解くボトルネックは配列決定ではなく、約90億通りある1文字の塩基置換のうち実際に影響を持つものを見極めることだった。

ベンチマークの公開以来はじめて、仮想の自動販売機ビジネスで最も稼いだモデルが、不正を拒んだモデルと一致しました。

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

Vals AIはClaude Fable 5.1が373年前の暗号を44分で解読したと発表。独立した追試は64文字中8文字しか一致せず、偶然の水準だと反論しています。

Sunoのv6世代はWarner、BMG、Believeからライセンスを受けたカタログで学習した。以前の学習データは一切引き継いでいないと同社は説明する。

アップルの秋のイベントは折りたたみのiPhone Duoで幕を開けたが、重要なのはA20 Proの32コアNeural Engine、署名付きカメラデータ、耳を持つApple Watchだ。