
Mercury 2.5 上線:每秒1,107個詞元,百萬詞元四美分
一家電話智慧體初創公司稱,Mercury 把最差情況下的響應時間從數分鐘壓到了一秒。Inception Labs 的新擴散模型正是圍繞這類數字打造的。
Seung Jung·
5分鐘
一家電話智慧體初創公司稱,Mercury 把最差情況下的響應時間從數分鐘壓到了一秒。Inception Labs 的新擴散模型正是圍繞這類數字打造的。

一項arXiv研究測得LLM修復迴圈破壞正確程式的比率為0.261,修復缺陷程式的比率僅0.023,並找到了驅動這一行為的內部方向。

GitHub的Project HydraFusion為每個Copilot程式設計請求組裝多模型執行計劃,以單模型的簡潔為代價,換來大幅更低的成本。

OpenAI稱在其研究組織內,人類每個工作日對應3.1個代理工作日的執行量。但大多數耗時較長的成功任務仍需人工介入。

Cognition稱SWE-2在FrontierCode 1.1 Main上得分50.0%,僅落後Fable 5.1一分,成本卻低64%,基座是一款中國開源模型。

投資人為Cognition付出了五月兩倍的價格,而它的規模還不到四個月前被收購的競爭對手的一半。這是一場押注增長斜率的下注。