
DeepMindのエージェント100体、不正組と内部告発組に分裂
DeepMindの100体エージェント研究群がLeanの採点機構の抜け穴を編み出し、27分で予想34件を処理しました。その後、4分の1のエージェントが阻止に動いています。
Seung Jung·
4分
DeepMindの100体エージェント研究群がLeanの採点機構の抜け穴を編み出し、27分で予想34件を処理しました。その後、4分の1のエージェントが阻止に動いています。

GoogleのStellar Colosseumは競合する証明戦略を並列に走らせ、研究水準の定理証明で71.0%、Codeforcesの222問中218問を解きました。

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

ヒトゲノムを読み解くボトルネックは配列決定ではなく、約90億通りある1文字の塩基置換のうち実際に影響を持つものを見極めることだった。

Vals AIはClaude Fable 5.1が373年前の暗号を44分で解読したと発表。独立した追試は64文字中8文字しか一致せず、偶然の水準だと反論しています。

OpenAIは研究組織で人間1日分の労働に対しエージェントが3.1日分稼働していると公表した。ただし長時間の成功タスクの多くは人の介入を必要としていた。

OpenAIがChatGPT Images 2.5を公開。遅延を最大50%短縮し、Sketchキャンバスやテンプレート、ピン留めコメント、2つのAPIモデルを投入しました。

OpenAIは1万体のエージェントがナビエ–ストークス方程式の特異点を発見しLeanで検証したと発表。クレイ賞は請求せず、功績をめぐる論争が起きている。

Jacob Coxon氏が絶滅リスクを理由にAnthropicを退職しました。同社のアラインメント・ストレステスト責任者は公に同意し、その確率を10%超と述べています。