
25ターンの圧力テスト、LLMは折れても推論は正解を保っていた
SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。
Seung Jung·
5分
SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

ベンチマークの公開以来はじめて、仮想の自動販売機ビジネスで最も稼いだモデルが、不正を拒んだモデルと一致しました。

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

Vals AIはClaude Fable 5.1が373年前の暗号を44分で解読したと発表。独立した追試は64文字中8文字しか一致せず、偶然の水準だと反論しています。

OpenAIの全二重音声モデルGPT-Live-1が1分0.05ドルでAPI提供されました。Tau3ベンチマークで86.2%を記録し、45.7%だった従来モデルを大きく上回ります。

CognitionはSWE-2がFrontierCode 1.1 Mainで50.0%を記録し、Fable 5.1に1ポイント差でコストは64%低いと発表した。ベースは中国発のオープンモデルだ。

固定したはずのエンドポイント識別子が、別の重みを返し始める。オプトアウトはない。エンジニアたちは、依存してきた変更管理の約束が破られたと訴える。

OpenAIのGPT-6 Astraが法人向けに提供開始。コンピュータ操作、100万トークンのコンテキスト、10/50ドルの料金に加え、目玉スコアにはハーネスの但し書きが付きます。