小米在 9 月 21 日以 MIT 授權公開了 MiMo-V2.6-Pro-RL 的權重,同時釋出 Flash 版本、以 Qwen3.5 為底的 9B 蒸餾模型、技術報告,以及背後所用的強化學習環境與訓練程式。這是一個總參數 1.02 兆、每個 token 啟用 420 億參數的混合專家模型。不過比排行榜名次更值得看的,是它跨世代的分數跳躍。
重點摘要
- MiMo-V2.6-Pro 在 Artificial Analysis 智慧指數上拿到 46 分,是所有開放權重模型中的最高分,僅落後 GPT-5.6 Sol 一分。
- 上一代 MiMo-V2.5-Pro 在 DeepSWE v1.1 得 19.0、Terminal Bench 4.0 得 1.5;同樣的測試,V2.6-Pro 交出 71.9 與 34.9。
- API 價格維持不變:輸入每百萬 token 0.435 美元,輸出每百萬 token 0.87 美元,Pro 與 Flash 同價。
真正的新聞是落差
開放權重的發布,通常主打自己離封閉前沿有多近。但小米自家表格中資訊量更大的,其實是標示這個模型起點的那一欄。在代理式軟體工程上,V2.5-Pro 只有 19.0,V2.6-Pro 則來到 71.9。在最難的終端機基準上,舊模型 1.5 分幾乎等於無法運作,新模型則跨過 34.9。GDPval-AA 2.1 的專業工作 Elo 也從 1,107 移動到 1,673。
小米把這歸因於一項被它稱為「You Only RL Once」的設計選擇:不再按領域分開跑強化學習,而是把編碼、通用代理、視覺與資安任務,連同多種代理框架一起混進同一批訓練批次,理由是這些能力會彼此增強,並能遷移到訓練期間從未見過的框架上。整個訓練採完全非同步的 GRPO,每一步用 1,568 個提示詞與 16 次 rollout。
與封閉前沿相比的位置
| 基準測試 | MiMo-V2.6 Pro | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 19.0 | 74.0 | 73.0 |
| AutomationBench v1.0.6 | 53.1 | 16.0 | 50.3 | 45.8 |
| Terminal Bench 2.1 | 89.9 | 65.2 | 89.1 | 88.8 |
| Terminal Bench 4.0 | 34.9 | 1.5 | 49.0 | 39.9 |
| Agents' Last Exam | 31.6 | 13.2 | 31.6 | 30.8 |
| ProgramBench | 26.5 | 12.5 | 37.0 | 25.0 |
| ExploitBench | 47.9 | 16.6 | 70.0 | 78.5 |
| MiMo VisualCoding | 72.3 | — | 70.0 | 73.4 |
橫著看,這個模型在自動化與工具使用的列上勝出,在 Agents' Last Exam 上與 Opus 5 打平,接著在兩個地方明顯落後。其一是競賽程式設計:ProgramBench 拿 26.5,不及 Opus 5 的 37.0。其二是攻擊性資安,而且差距更大:ExploitBench 為 47.9,Sol 則有 78.5。
每項任務只要二十分之一的成本
小米把 API 價格從 V2.5 世代原封不動沿用:輸入每百萬 token 0.435 美元,命中快取另有 99% 折扣,輸出每百萬 token 0.87 美元,Pro 與 Flash 同一費率。OfficeChai 對 Artificial Analysis 資料的分析換算出每項智慧指數任務 0.13 美元,並把這個模型放在智慧與成本的柏拉圖前沿上;指數分數本身也在一個世代內從 26 升到 46。在這次釋出之前,開放權重的第一名由 Z.AI 的 GLM-5.3 與 Moonshot 的 Kimi K3 以 44 分並列。
底層是什麼
它的架構原生就是全模態,而不是在文字模型上外掛轉接層:6.81 億參數的視覺編碼器與 3.08 億參數的音訊 tokenizer 餵進同一套主幹,主幹共 70 層,交替使用滑動視窗注意力與全域注意力,並在 384 個路由專家中啟用 8 個。脈絡長度達到一百萬 token,五層的推測式解碼器可在單次前向運算中預測 7 個 token。官方同時提供 SGLang 與 vLLM 的部署配方,模型也接上了 OpenRouter 與小米自家平台。
後續觀察重點
競爭對手的實驗室會細讀的,是它不只公開權重,還一併公開了 RL 環境與評分機制——這是交出一件成品與交出一套可複現方法之間的差別。對採購方而言,近期的問題是:一個可自行部署、代理能力逼近前沿的開放權重模型,會不會改變採購決策。這股轉向在開放模型如今承載的閘道流量比重上已經看得見。
FAQ — 常見問題
MiMo-V2.6 是開源的嗎?
MiMo-V2.6-Pro-RL 與 MiMo-V2.6-Flash-RL 的權重以 MIT 授權發布在 Hugging Face 上,連同技術報告、RL 環境與訓練程式一起公開。這代表不必另外談授權就能商用自行部署與微調。
MiMo-V2.6-Pro 有多大?
它是一個稀疏混合專家模型,總參數 1.02 兆,每個 token 啟用 420 億,在 384 個路由專家中啟用 8 個。它原生處理文字、圖片、影片與音訊,並支援一百萬 token 的脈絡長度。
它贏過 Claude Opus 5 嗎?
只在部分項目上贏。MiMo-V2.6-Pro 在 AutomationBench v1.0.6 與 Terminal Bench 2.1 領先,在 Agents' Last Exam 打平,但在 DeepSWE v1.1、Terminal Bench 4.0、ProgramBench 與 ExploitBench 上落後 Opus 5。上述數字全部出自小米自行公布的測試結果。






