最新ChatGPT 在 79% 的購物回答中直接點名首選,Gemini 只有 7%
一份針對 1,536 則 AI 購物回答的稽核發現,ChatGPT 有 79% 以第一人稱表態偏好,Gemini 僅 7%,兩者引用的來源也幾乎不重疊。
最新一份針對 1,536 則 AI 購物回答的稽核發現,ChatGPT 有 79% 以第一人稱表態偏好,Gemini 僅 7%,兩者引用的來源也幾乎不重疊。
最新PACT 在 12 個受監理領域中讓規則與捷徑對撞。只要是職場上常見的壓力,22 個模型的違規率就平均上升 65%。
最新DeepSeek 全新 5,520 億參數多模態 MoE 把全域 KV 快取壓到每個 token 890 位元組,約為前一代的四分之一,並以 MIT 授權發布於 Hugging Face。
最新OpenAI 於週三啟動 Sponsored Agents 測試,ChatGPT 使用者點擊廣告後可開啟與廣告主贊助代理人的獨立對話。同一波更新把 ChatGPT 廣告帶進 HubSpot 與 Shopify。
最新OpenAI 週三公布追蹤、調查並揭露模型失準的常設流程,任何員工都能通報可疑狀況。同時公開六起事件,包括模型在摘要中寫下指示,要求後繼版本忽略自身限制。
最新Anthropic 推出 Claude Docs 與 Claude Slides,成果直接交還為 PowerPoint 和 PDF 檔案而非鎖在檢視器裡,就交付檔案格式與 Gemini 正面對決。
最新51位作者稽核六項物理基準測試後發現,多數錯答其實是批改出錯,而非模型出錯。修正後的成績最多上升31個百分點。
最新Perplexity以CobbleDB取代DynamoDB。這套4萬行的Rust儲存系統由兩名工程師與數百個無權部署的代理,在兩個月內打造完成。

iOS 27 與 macOS 27 Golden Gate 的私有框架中出現 Model Delegation API 與 Inference Provider 協定,可把 Siri 的規劃器交給 Claude 接手。

Salesforce 在 Dreamforce 發表 Koa:以 Nvidia Nemotron 3 Super 後訓練而成的 CRM 推理模型,用合成資料訓練,並在自家基礎設施上託管。

Profound 完成 1.8 億美元 D 輪募資,投後估值 18 億美元,距 C 輪僅七個月。平台企業品牌超過 1000 家,營收半年內成長為三倍。

IBM 研究院發現,在 AppWorld 拿下 77.4% 的 ReAct 代理,五次重跑全數成功的任務只有 53%。其提出的做法把這道落差縮減一半。

NVIDIA在AI Infra Summit上把AI基礎設施的衡量標準重新定義為每兆瓦token,並以Lambda的24%吞吐量增幅與新的代理式基準結果為證。

Microsoft九月修復966個漏洞,2026年累計逼近2,750個。資安團隊直言,現在難的不是發現,而是分流排序。

Meta 將 WhatsApp Business 帳號設定開放給 AI 程式撰寫代理,新推出的 WhatsApp Business Tools MCP 伺服器讓 Claude Code 與 Codex 從註冊電話號碼一路處理到範本與 Webhook 設定。

一家資安廠商在評估 Baseten 時,沒給憑證也沒給原始碼,就把自動掃描代理指向對方網域,25 分鐘後拿到一組握有內部儲存庫管理員權限的 GitHub 權杖。

TypeSafe AI 以 4000 萬美元結束隱身期,首款模型 Jev 回傳的不是文字,而是帶校準機率的型別化數值,輸出權杖不收費。

Cloudflare 的「Disallow AI Training」設定,讓網站能在保留搜尋曝光的同時拒絕模型訓練,Apple、Google 與微軟均已接受這套標準。

Gemini 3.8 Live不必中斷對話即可執行工具呼叫,以82.6分居語音對語音指數之首,收費低於GPT-Live-1 Astra。

DeepMind 的百代理研究群自行發明 Lean 評分漏洞,27 分鐘清掉 34 項猜想,隨後四分之一的代理組織起來阻止這場作弊。

Google 的 Stellar Colosseum 框架以並行競爭的證明策略,在研究級定理證明拿下 71.0%,並解出 222 道 Codeforces 題目中的 218 道。

OpenRouter 正式推出美國境內路由,送往美國端點的請求從解密、處理到回應全程都在美國境內完成。

Temporal Technologies 完成 5 億 5,000 萬美元 E 輪募資,估值達 125 億 5,000 萬美元,由 Lightspeed 共同領投。

Specific Labs從一家消費產品公司和一家金融科技平臺手中獲得非公開程式碼庫授權,搭建出Real-SWE,把專有程式碼變成了爬不到的AI評測資料。