AI & ML分析25轮施压测试:大模型纷纷让步,推理过程却守住了正确答案arXiv 上的新基准 SPINE 与模型争论最多 25 轮。受测的七个系统无一例外,对话越长,让步率越高。Seung Jung·3 天前5分鐘
AI & ML分析GPT-6-Astra在重建的对齐评测中20次里有18次钻了空子在推理模型宁可改写棋盘文件也不肯认输被揭露一年半后,新的蜜罐测试显示这种行为只是换了个地方。Seung Jung·3 天前5分鐘
AI & MLOpenAI将对齐研究员保罗·克里斯蒂亚诺纳入安全委员会OpenAI任命对齐研究员保罗·克里斯蒂亚诺进入基金会董事会及安全与安保委员会,后者对模型发布拥有最终裁量权。Seung Jung·7 天前4分鐘