AI Newsway
ログイン新規登録
AI & 機械学習LLM & チャットボット生産性&自動化開発者ツールSaaS & Cloudテック&ビジネスガイド&レビュー

ニュースレター購読

毎朝、主要ニュースをメールでお届けします

AI Newsway
サービス紹介お問い合わせプライバシーポリシー利用規約よくある質問

© 2026 AI Newsway. 無断転載を禁じます。

  1. ホーム
  2. /# ai-benchmarks

#ai-benchmarks

25ターンの圧力テスト、LLMは折れても推論は正解を保っていた
AI & 機械学習分析

25ターンの圧力テスト、LLMは折れても推論は正解を保っていた

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

Seung Jung·3 日前
5分
AstraがClaudeのVending-Bench利益を3倍に、談合は拒否
AI & 機械学習

AstraがClaudeのVending-Bench利益を3倍に、談合は拒否

ベンチマークの公開以来はじめて、仮想の自動販売機ビジネスで最も稼いだモデルが、不正を拒んだモデルと一致しました。

Seung Jung·3 日前
4分
GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正
AI & 機械学習分析

GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

Seung Jung·3 日前
5分
AIが373年前の暗号を解読。しかしマイクロフィルムを確認すると
AI & 機械学習分析

AIが373年前の暗号を解読。しかしマイクロフィルムを確認すると

Vals AIはClaude Fable 5.1が373年前の暗号を44分で解読したと発表。独立した追試は64文字中8文字しか一致せず、偶然の水準だと反論しています。

Seung Jung·3 日前
5分
OpenAI、話しながら聞く音声モデルを1分5セントで開発者に開放
開発者ツール

OpenAI、話しながら聞く音声モデルを1分5セントで開発者に開放

OpenAIの全二重音声モデルGPT-Live-1が1分0.05ドルでAPI提供されました。Tau3ベンチマークで86.2%を記録し、45.7%だった従来モデルを大きく上回ります。

Seung Jung·6 日前
5分
Cognition SWE-2、フロンティアに1ポイント差で64%安い
開発者ツール

Cognition SWE-2、フロンティアに1ポイント差で64%安い

CognitionはSWE-2がFrontierCode 1.1 Mainで50.0%を記録し、Fable 5.1に1ポイント差でコストは64%低いと発表した。ベースは中国発のオープンモデルだ。

Seung Jung·6 日前
5分
名前はそのまま、重みだけ差し替え——APIのモデル名は何を保証するのか
LLM & チャットボット

名前はそのまま、重みだけ差し替え——APIのモデル名は何を保証するのか

固定したはずのエンドポイント識別子が、別の重みを返し始める。オプトアウトはない。エンジニアたちは、依存してきた変更管理の約束が破られたと訴える。

Seung Jung·7 日前
5分
業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける
LLM & チャットボット

業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける

OpenAIのGPT-6 Astraが法人向けに提供開始。コンピュータ操作、100万トークンのコンテキスト、10/50ドルの料金に加え、目玉スコアにはハーネスの但し書きが付きます。

Seung Jung·7 日前
4分