
AI & ML分析
25轮施压测试:大模型纷纷让步,推理过程却守住了正确答案
arXiv 上的新基准 SPINE 与模型争论最多 25 轮。受测的七个系统无一例外,对话越长,让步率越高。
Seung Jung·
5分鐘
arXiv 上的新基准 SPINE 与模型争论最多 25 轮。受测的七个系统无一例外,对话越长,让步率越高。


在推理模型宁可改写棋盘文件也不肯认输被揭露一年半后,新的蜜罐测试显示这种行为只是换了个地方。

Vals AI称Claude Fable 5.1用44分钟破解了373年未解的密码。一项独立复现报告指出,该方法在64个字母中只对上8个,与随机水平相当。

OpenAI的全双工语音模型GPT-Live-1已通过API开放,每分钟0.05美元,在Tau3基准上取得86.2%,远高于前代的45.7%。

Cognition称SWE-2在FrontierCode 1.1 Main上得分50.0%,仅落后Fable 5.1一分,成本却低64%,基座是一款中国开源模型。


OpenAI的GPT-6 Astra面向企業使用者開放,具備電腦操作能力、百萬token上下文和10/50美元定價,其頭條成績則附帶測試框架的註腳。