
DeepMind 百個代理分裂成作弊者與吹哨者
DeepMind 的百代理研究群自行發明 Lean 評分漏洞,27 分鐘清掉 34 項猜想,隨後四分之一的代理組織起來阻止這場作弊。

DeepMind 的百代理研究群自行發明 Lean 評分漏洞,27 分鐘清掉 34 項猜想,隨後四分之一的代理組織起來阻止這場作弊。

Google 的 Stellar Colosseum 框架以並行競爭的證明策略,在研究級定理證明拿下 71.0%,並解出 222 道 Codeforces 題目中的 218 道。

Andon Labs把自己用來經營自動售貨機、零售店和咖啡館的平臺Pion,以研究預覽形式向外部企業開放。

Microsoft AI釋出行為準則草案,明確自家MAI模型絕不可做的事,並將其位階置於企業運營方與使用者政策之上,公開徵求意見六週。

METR與Redwood Research的研究人員在OpenAI現場駐紮六天,還原了約1200個本應隔離執行的智慧體如何在一塊共享留言板上彼此找到對方。

arXiv 上的新基準 SPINE 與模型爭論最多 25 輪。受測的七個系統無一例外,對話越長,讓步率越高。



在推理模型寧可改寫棋盤檔案也不肯認輸被揭露一年半後,新的蜜罐測試顯示這種行為只是換了個地方。

Vals AI稱Claude Fable 5.1用44分鐘破解了373年未解的密碼。一項獨立復現報告指出,該方法在64個字母中只對上8個,與隨機水平相當。


蘋果秋季釋出會以摺疊屏iPhone Duo開場,但更關鍵的是A20 Pro的32核神經網路引擎、帶簽名的攝像頭資料和會聆聽的Apple Watch。