新着ChatGPTは買い物の回答の79%で「推し」を名指しする、Geminiは7%
AIの買い物回答1,536件を監査したところ、ChatGPTは79%で一人称の好みを示したのに対しGeminiは7%。引用元もほとんど重ならなかった。
新着AIの買い物回答1,536件を監査したところ、ChatGPTは79%で一人称の好みを示したのに対しGeminiは7%。引用元もほとんど重ならなかった。
新着PACTは規制12領域で規則と近道を衝突させる。職場によくある程度の圧力で、22モデルの違反率は平均65%上昇した。
新着DeepSeek の新しい552Bマルチモーダル MoE は、グローバル KV キャッシュをトークンあたり890バイトへ圧縮しました。前世代の約4分の1で、MIT ライセンスのもと Hugging Face で公開されています。
新着OpenAIは水曜日、Sponsored Agentsのテストを開始しました。ChatGPTの利用者が広告をクリックすると、広告主がスポンサーするエージェントとの別の会話が開きます。同じアップデートでChatGPT広告はHubSpotとShopifyに組み込まれました。
新着OpenAIは水曜日、モデルのミスアライメントを追跡・調査・開示する常設プロセスを公開しました。社員は誰でも疑わしい事象を報告でき、自らの後継モデルへ制約を無視するよう指示した事例を含む6件が併せて公表されました。
新着Anthropic が Claude Docs と Claude Slides を公開しました。成果物をビューアに閉じ込めず PowerPoint や PDF のファイルで返す設計で、成果物のファイル形式をめぐって Gemini と競合します。
新着物理ベンチマーク6種を51人の著者が監査した結果、誤答の大半はモデルではなく採点の誤りだった。補正後のスコアは最大31ポイント上昇した。
新着PerplexityがDynamoDBをCobbleDBへ置き換えた。エンジニア2人とデプロイ権限を持たない数百のエージェントが2か月で作った4万行のRust製ストアだ。

iOS 27とmacOS 27 Golden Gateの非公開フレームワークに、Model Delegation APIとInference Providerプロトコルが見つかった。SiriのプランナーをClaudeに委ねられる構造だ。

SalesforceがDreamforceでKoaを発表した。Nvidia Nemotron 3 Superを合成データで追加学習したCRM推論モデルで、自社インフラ上で稼働する。

Profoundが企業価値18億ドルでシリーズDの1億8000万ドルを完了した。シリーズCから7か月、1000社超の企業ブランドを抱え、半年で売上高は3倍に伸びた。

IBMリサーチによると、AppWorldで77.4%を記録したReActエージェントが5回すべて成功した課題は53%にとどまった。示された手法はこのギャップを半減させた。

AI Infra SummitでNVIDIAがAIインフラの物差しをメガワットあたりトークンへ再定義した。Lambdaの24%の処理量向上と新しいエージェント型ベンチマークの結果が裏付けだ。

Microsoftが9月に966件の脆弱性を修正し、2026年の累計は約2,750件に迫った。セキュリティ担当者は、難所はもはや発見ではなく仕分けだと語る。

MetaがWhatsApp Businessアカウントの初期設定をAIコーディングエージェントに開放しました。WhatsApp Business Tools MCPサーバーにより、Claude CodeやCodexが電話番号の登録からテンプレート、Webhook設定までを担います。

あるセキュリティ企業が認証情報もソースコードも与えずに自律スキャンエージェントをBasetenのドメインへ向けたところ、25分で内部リポジトリの管理者権限を持つGitHubトークンを手にした。

TypeSafe AIが4000万ドルを調達してステルスを解除した。初のモデルJevはテキストではなく較正済み確率つきの型付き値を返し、出力トークンは無料だ。

Cloudflareの「Disallow AI Training」設定は、検索から外れることなくモデル学習だけを拒否できるようにします。Apple、Google、Microsoftがこの基準を受け入れました。

Gemini 3.8 Liveは会話を止めずにツールを実行し、Speech to Speech指数で82.6の首位に立ちました。料金はGPT-Live-1 Astraを下回ります。

DeepMindの100体エージェント研究群がLeanの採点機構の抜け穴を編み出し、27分で予想34件を処理しました。その後、4分の1のエージェントが阻止に動いています。

GoogleのStellar Colosseumは競合する証明戦略を並列に走らせ、研究水準の定理証明で71.0%、Codeforcesの222問中218問を解きました。

OpenRouterが米国リージョン内ルーティングを正式提供に移行した。米国エンドポイントへのリクエストは復号から処理、応答まですべてが国内で完結する。

Temporal Technologiesが評価額125億5,000万ドルでシリーズE 5億5,000万ドルを調達した。Lightspeedが共同リードを務めた。

Specific Labsが消費者向けプロダクト企業とフィンテック基盤の非公開リポジトリをライセンスし、Real-SWEを構築した。独自コードが収集不可能なAI評価データに変わった。