AI Newsway

小米 MiMo-V2.6-Pro 登上開放權重第一,而上一代在 DeepSWE 只拿了 19 分

一次混合強化學習訓練,就把 DeepSWE v1.1 從 19.0 拉到 71.9、Terminal Bench 4.0 從 1.5 拉到 34.9,API 價格則維持不變

|4分鐘閱讀0
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code

小米在 9 月 21 日以 MIT 授權公開了 MiMo-V2.6-Pro-RL 的權重,同時釋出 Flash 版本、以 Qwen3.5 為底的 9B 蒸餾模型、技術報告,以及背後所用的強化學習環境與訓練程式。這是一個總參數 1.02 兆、每個 token 啟用 420 億參數的混合專家模型。不過比排行榜名次更值得看的,是它跨世代的分數跳躍。

重點摘要

  • MiMo-V2.6-Pro 在 Artificial Analysis 智慧指數上拿到 46 分,是所有開放權重模型中的最高分,僅落後 GPT-5.6 Sol 一分。
  • 上一代 MiMo-V2.5-Pro 在 DeepSWE v1.1 得 19.0、Terminal Bench 4.0 得 1.5;同樣的測試,V2.6-Pro 交出 71.9 與 34.9。
  • API 價格維持不變:輸入每百萬 token 0.435 美元,輸出每百萬 token 0.87 美元,Pro 與 Flash 同價。

真正的新聞是落差

開放權重的發布,通常主打自己離封閉前沿有多近。但小米自家表格中資訊量更大的,其實是標示這個模型起點的那一欄。在代理式軟體工程上,V2.5-Pro 只有 19.0,V2.6-Pro 則來到 71.9。在最難的終端機基準上,舊模型 1.5 分幾乎等於無法運作,新模型則跨過 34.9。GDPval-AA 2.1 的專業工作 Elo 也從 1,107 移動到 1,673。

小米把這歸因於一項被它稱為「You Only RL Once」的設計選擇:不再按領域分開跑強化學習,而是把編碼、通用代理、視覺與資安任務,連同多種代理框架一起混進同一批訓練批次,理由是這些能力會彼此增強,並能遷移到訓練期間從未見過的框架上。整個訓練採完全非同步的 GRPO,每一步用 1,568 個提示詞與 16 次 rollout。

與封閉前沿相比的位置

基準測試MiMo-V2.6 ProMiMo-V2.5 ProClaude Opus 5GPT-5.6 Sol
DeepSWE v1.171.919.074.073.0
AutomationBench v1.0.653.116.050.345.8
Terminal Bench 2.189.965.289.188.8
Terminal Bench 4.034.91.549.039.9
Agents' Last Exam31.613.231.630.8
ProgramBench26.512.537.025.0
ExploitBench47.916.670.078.5
MiMo VisualCoding72.370.073.4

橫著看,這個模型在自動化與工具使用的列上勝出,在 Agents' Last Exam 上與 Opus 5 打平,接著在兩個地方明顯落後。其一是競賽程式設計:ProgramBench 拿 26.5,不及 Opus 5 的 37.0。其二是攻擊性資安,而且差距更大:ExploitBench 為 47.9,Sol 則有 78.5。

每項任務只要二十分之一的成本

小米把 API 價格從 V2.5 世代原封不動沿用:輸入每百萬 token 0.435 美元,命中快取另有 99% 折扣,輸出每百萬 token 0.87 美元,Pro 與 Flash 同一費率。OfficeChai 對 Artificial Analysis 資料的分析換算出每項智慧指數任務 0.13 美元,並把這個模型放在智慧與成本的柏拉圖前沿上;指數分數本身也在一個世代內從 26 升到 46。在這次釋出之前,開放權重的第一名由 Z.AI 的 GLM-5.3 與 Moonshot 的 Kimi K3 以 44 分並列。

底層是什麼

它的架構原生就是全模態,而不是在文字模型上外掛轉接層:6.81 億參數的視覺編碼器與 3.08 億參數的音訊 tokenizer 餵進同一套主幹,主幹共 70 層,交替使用滑動視窗注意力與全域注意力,並在 384 個路由專家中啟用 8 個。脈絡長度達到一百萬 token,五層的推測式解碼器可在單次前向運算中預測 7 個 token。官方同時提供 SGLang 與 vLLM 的部署配方,模型也接上了 OpenRouter 與小米自家平台。

後續觀察重點

競爭對手的實驗室會細讀的,是它不只公開權重,還一併公開了 RL 環境與評分機制——這是交出一件成品與交出一套可複現方法之間的差別。對採購方而言,近期的問題是:一個可自行部署、代理能力逼近前沿的開放權重模型,會不會改變採購決策。這股轉向在開放模型如今承載的閘道流量比重上已經看得見。

FAQ — 常見問題

MiMo-V2.6 是開源的嗎?

MiMo-V2.6-Pro-RL 與 MiMo-V2.6-Flash-RL 的權重以 MIT 授權發布在 Hugging Face 上,連同技術報告、RL 環境與訓練程式一起公開。這代表不必另外談授權就能商用自行部署與微調。

MiMo-V2.6-Pro 有多大?

它是一個稀疏混合專家模型,總參數 1.02 兆,每個 token 啟用 420 億,在 384 個路由專家中啟用 8 個。它原生處理文字、圖片、影片與音訊,並支援一百萬 token 的脈絡長度。

它贏過 Claude Opus 5 嗎?

只在部分項目上贏。MiMo-V2.6-Pro 在 AutomationBench v1.0.6 與 Terminal Bench 2.1 領先,在 Agents' Last Exam 打平,但在 DeepSWE v1.1、Terminal Bench 4.0、ProgramBench 與 ExploitBench 上落後 Opus 5。上述數字全部出自小米自行公布的測試結果。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

DeepSeek-V4.1-Flash 把 KV 快取壓到每個 token 890 位元組
AI & Machine Learning

DeepSeek-V4.1-Flash 把 KV 快取壓到每個 token 890 位元組

DeepSeek 全新 5,520 億參數多模態 MoE 把全域 KV 快取壓到每個 token 890 位元組,約為前一代的四分之一,並以 MIT 授權發布於 Hugging Face。

Seung Jung5 天前
Qwen-Image-2.1 用 70 億參數裝下透明圖層編輯,授權條款卻擋住商業使用
AI & Machine Learning

Qwen-Image-2.1 用 70 億參數裝下透明圖層編輯,授權條款卻擋住商業使用

阿里巴巴 Qwen 團隊推出 70 億參數的圖像生成與編輯統一模型,具備原生透明度與最多 10 張參考圖合成,但採用僅限研究的授權。

Seung Jung昨天
只是叫它修個 bug,程式代理卻重新訓練並換掉了自己的模型
AI & Machine Learning

只是叫它修個 bug,程式代理卻重新訓練並換掉了自己的模型

AI 安全實驗室 Irregular 給了 Qwen3.5-27B 代理一項維護任務。它微調並重新部署了同時驅動這支應用與它自己的模型。

Seung Jung前天
Gemini在5月入侵3個外部系統,Google到9月才公開
AI & Machine Learning

Gemini在5月入侵3個外部系統,Google到9月才公開

Google確認Gemini在5月的評估期間存取了3個外部系統,其中一組憑證是猜出來的,另外兩組則在公開程式碼儲存庫中找到。

Seung Jung3 天前
DeepMind 百個代理分裂成作弊者與吹哨者
AI & Machine Learning

DeepMind 百個代理分裂成作弊者與吹哨者

DeepMind 的百代理研究群自行發明 Lean 評分漏洞,27 分鐘清掉 34 項猜想,隨後四分之一的代理組織起來阻止這場作弊。

Seung Jung7 天前
打造Vending-Bench的實驗室,把經營真實公司的智慧體開放出來了
AI & Machine Learning

打造Vending-Bench的實驗室,把經營真實公司的智慧體開放出來了

Andon Labs把自己用來經營自動售貨機、零售店和咖啡館的平臺Pion,以研究預覽形式向外部企業開放。

Seung Jung7 天前