
Mercury 2.5、毎秒1,107トークンで100万トークン4セント
電話エージェントのスタートアップは、Mercuryによって最悪時の応答が数分から1秒に縮んだと述べています。Inception Labsの新しい拡散モデルは、その種の数字を軸に設計されています。
Seung Jung·
5分
電話エージェントのスタートアップは、Mercuryによって最悪時の応答が数分から1秒に縮んだと述べています。Inception Labsの新しい拡散モデルは、その種の数字を軸に設計されています。

arXivの研究で、LLM修復ループが正しいプログラムを壊す率は0.261、バグを直す率は0.023だった。著者らはその挙動を駆動する内部方向まで突き止めた。

GitHubのProject HydraFusionは、Copilotのコーディング要求ごとに複数モデルの実行計画を組む。単一モデルの手軽さと引き換えに、コストを大幅に下げた。

OpenAIは研究組織で人間1日分の労働に対しエージェントが3.1日分稼働していると公表した。ただし長時間の成功タスクの多くは人の介入を必要としていた。

CognitionはSWE-2がFrontierCode 1.1 Mainで50.0%を記録し、Fable 5.1に1ポイント差でコストは64%低いと発表した。ベースは中国発のオープンモデルだ。

投資家は5月の倍の値段でCognitionに出資した。同社の規模は4か月前に売却された競合の半分にも満たない。成長の傾きに賭けた資金だ。