シャオミは9月21日、MiMo-V2.6-Pro-RLの重みをMITライセンスで公開した。姉妹モデルのFlash、Qwen3.5を土台にした9Bの蒸留版、技術レポート、そして学習に使った強化学習環境とコードも合わせて出している。総パラメータ1.02兆の混合エキスパート(MoE)モデルで、トークンあたり420億が活性化する。ただ、順位表の位置より目を引くのはその背後にある世代間の跳ね上がりだ。
要点
- MiMo-V2.6-ProはArtificial Analysisインテリジェンス指数で46点を記録した。オープンウェイトモデルでは最高で、GPT-5.6 Solに1点差まで迫る。
- 前世代のMiMo-V2.5-ProはDeepSWE v1.1で19.0、Terminal Bench 4.0で1.5だった。同じテストでV2.6-Proは71.9と34.9を出している。
- API価格は据え置きで、入力100万トークンあたり0.435ドル、出力100万トークンあたり0.87ドル。ProとFlashで同額だ。
読むべきは差分だ
オープンウェイトの公開は、たいてい閉じたフロンティアにどれだけ近づいたかを売り文句にする。だがシャオミ自身の表でより多くを語るのは、このモデルがどこから出発したかを示す列のほうだ。エージェント的なソフトウェア開発でV2.5-Proは19.0止まりだったが、V2.6-Proは71.9に届く。最難関のターミナル系ベンチマークでは、旧モデルは1.5と事実上機能していなかったのに対し、新モデルは34.9を超えた。GDPval-AA 2.1の専門業務Eloは1,107から1,673へ動いている。
シャオミはこれを「You Only RL Once」と名付けた設計上の一手に帰している。領域ごとに強化学習を別々に回すのではなく、コーディング、汎用エージェント、視覚、サイバーセキュリティの課題を複数のエージェントハーネスとともに同じバッチへ混ぜ込んだ。能力同士が互いを強化し、学習中に見ていないハーネスへも転移するという仮説に基づく選択だ。学習は完全非同期のGRPOで、1ステップあたりプロンプト1,568件、ロールアウト16回を回した。
閉じたフロンティアと並べると
| ベンチマーク | MiMo-V2.6 Pro | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 19.0 | 74.0 | 73.0 |
| AutomationBench v1.0.6 | 53.1 | 16.0 | 50.3 | 45.8 |
| Terminal Bench 2.1 | 89.9 | 65.2 | 89.1 | 88.8 |
| Terminal Bench 4.0 | 34.9 | 1.5 | 49.0 | 39.9 |
| Agents' Last Exam | 31.6 | 13.2 | 31.6 | 30.8 |
| ProgramBench | 26.5 | 12.5 | 37.0 | 25.0 |
| ExploitBench | 47.9 | 16.6 | 70.0 | 78.5 |
| MiMo VisualCoding | 72.3 | — | 70.0 | 73.4 |
横に読むと、自動化とツール利用の行で勝ち、Agents' Last ExamではOpus 5と並ぶ。一方で明確に譲る箇所が2つある。ひとつは競技プログラミングで、ProgramBenchは26.5とOpus 5の37.0に届かない。もうひとつは攻撃的セキュリティで、こちらは差が大きい。ExploitBenchは47.9、Solの78.5とは開きがある。
タスクあたりのコストは20分の1
シャオミはV2.5世代からAPI価格を据え置いた。入力100万トークンあたり0.435ドルでキャッシュヒット時は99%割引、出力は100万トークンあたり0.87ドル、ProとFlashで同じ料率だ。Artificial Analysisのデータを分析したOfficeChaiは、インテリジェンス指数のタスク1件あたりを0.13ドルと算定し、知能対コストのパレートフロンティア上にこのモデルを置いた。指数そのものも1世代で26から46へ上がっている。今回の公開前まで、オープンウェイトの首位はZ.AIのGLM-5.3とMoonshotのKimi K3が44点で分け合っていた。
中身の構成
テキストモデルにアダプタを後付けしたものではなく、設計段階からオムニモーダルだ。6億8,100万パラメータの視覚エンコーダと3億800万パラメータの音声トークナイザが同じバックボーンに入力される。バックボーンは70層でスライディングウィンドウ注意とグローバル注意を交互に配し、384のルーティング専門家のうち8つを活性化する。コンテキストは100万トークンに達し、5層の投機的デコーダが1回の順伝播で7トークンを予測する。SGLangとvLLM向けのサービングレシピも同梱され、OpenRouterとシャオミ自社プラットフォーム経由でも呼び出せる。
今後の注目点
競合の研究所が読み込むのは、重みだけでなくRL環境と採点機構まで公開した点だろう。成果物を出すことと、再現可能な手法を出すことの違いがそこにある。購入側にとっての当面の問いは、フロンティアに迫るエージェント性能を持つ自前ホスト可能なオープンウェイトモデルが調達のあり方を変えるかどうかだ。その変化はゲートウェイのトラフィックに占めるオープンモデルの比率にすでに表れている。
FAQ — よくある質問
MiMo-V2.6はオープンソースなのか
MiMo-V2.6-Pro-RLとMiMo-V2.6-Flash-RLの重みが、MITライセンスでHugging Faceに公開されている。技術レポート、RL環境、学習コードも一緒だ。ライセンス交渉なしで商用の自前ホスティングとファインチューニングができる。
MiMo-V2.6-Proの規模は
総パラメータ1.02兆、トークンあたり活性420億のスパース混合エキスパートモデルで、384のルーティング専門家のうち8つが動く。テキスト、画像、動画、音声をネイティブに扱い、100万トークンのコンテキストに対応する。
Claude Opus 5を上回るのか
一部だけだ。MiMo-V2.6-ProはAutomationBench v1.0.6とTerminal Bench 2.1で上回り、Agents' Last Examでは並ぶ。一方でDeepSWE v1.1、Terminal Bench 4.0、ProgramBench、ExploitBenchではOpus 5に及ばない。数値はいずれもシャオミが公表した自社計測値である。






