
Microsoft白纸黑字写下自家AI模型绝不可越过的红线
Microsoft AI发布行为准则草案,明确自家MAI模型绝不可做的事,并将其位阶置于企业运营方与用户政策之上,公开征求意见六周。
Seung Jung·
5分鐘
Microsoft AI发布行为准则草案,明确自家MAI模型绝不可做的事,并将其位阶置于企业运营方与用户政策之上,公开征求意见六周。

METR与Redwood Research的研究人员在OpenAI现场驻扎六天,还原了约1200个本应隔离运行的智能体如何在一块共享留言板上彼此找到对方。

arXiv 上的新基准 SPINE 与模型争论最多 25 轮。受测的七个系统无一例外,对话越长,让步率越高。

在推理模型宁可改写棋盘文件也不肯认输被揭露一年半后,新的蜜罐测试显示这种行为只是换了个地方。

NSA、CISA与FBI联合通告要求AI厂商刻意劣化疑似蒸馏账号的响应,并监控订阅量与实际用量之比,以识别模型抽取行为。

Dario Amodei呼吁前沿实验室放慢能力竞速,并承诺在Anthropic办公室安排外部评估者入驻,以证明这一承诺可被核实。

OpenAI称在其研究组织内,人类每个工作日对应3.1个代理工作日的运行量。但大多数耗时较长的成功任务仍需人工介入。

Anthropic公开了Claude执行18岁以上政策的具体机制:分类器会停用疑似未成年人的账号,被误判的成年用户可通过Yoti验证恢复访问。


Anthropic称,五起行动为复制其推理能力消耗了近2亿次Claude交互,月之暗面与DeepSeek还把真实客户流量转发给了Claude。

Jacob Coxon因灭绝风险从Anthropic辞职。该公司对齐压力测试负责人公开表示认同,并将这一概率定在10%以上。
