シャオミのMiMo-V2.6-Proがオープンウェイト首位へ、前世代のDeepSWEは19点だった

混合強化学習を1回回しただけで、DeepSWE v1.1は19.0から71.9へ、Terminal Bench 4.0は1.5から34.9へ跳ねた。API価格は据え置きである

|4分で読める0
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code

シャオミは9月21日、MiMo-V2.6-Pro-RLの重みをMITライセンスで公開した。姉妹モデルのFlash、Qwen3.5を土台にした9Bの蒸留版、技術レポート、そして学習に使った強化学習環境とコードも合わせて出している。総パラメータ1.02兆の混合エキスパート(MoE)モデルで、トークンあたり420億が活性化する。ただ、順位表の位置より目を引くのはその背後にある世代間の跳ね上がりだ。

要点

  • MiMo-V2.6-ProはArtificial Analysisインテリジェンス指数で46点を記録した。オープンウェイトモデルでは最高で、GPT-5.6 Solに1点差まで迫る。
  • 前世代のMiMo-V2.5-ProはDeepSWE v1.1で19.0、Terminal Bench 4.0で1.5だった。同じテストでV2.6-Proは71.9と34.9を出している。
  • API価格は据え置きで、入力100万トークンあたり0.435ドル、出力100万トークンあたり0.87ドル。ProとFlashで同額だ。

読むべきは差分だ

オープンウェイトの公開は、たいてい閉じたフロンティアにどれだけ近づいたかを売り文句にする。だがシャオミ自身の表でより多くを語るのは、このモデルがどこから出発したかを示す列のほうだ。エージェント的なソフトウェア開発でV2.5-Proは19.0止まりだったが、V2.6-Proは71.9に届く。最難関のターミナル系ベンチマークでは、旧モデルは1.5と事実上機能していなかったのに対し、新モデルは34.9を超えた。GDPval-AA 2.1の専門業務Eloは1,107から1,673へ動いている。

シャオミはこれを「You Only RL Once」と名付けた設計上の一手に帰している。領域ごとに強化学習を別々に回すのではなく、コーディング、汎用エージェント、視覚、サイバーセキュリティの課題を複数のエージェントハーネスとともに同じバッチへ混ぜ込んだ。能力同士が互いを強化し、学習中に見ていないハーネスへも転移するという仮説に基づく選択だ。学習は完全非同期のGRPOで、1ステップあたりプロンプト1,568件、ロールアウト16回を回した。

閉じたフロンティアと並べると

ベンチマークMiMo-V2.6 ProMiMo-V2.5 ProClaude Opus 5GPT-5.6 Sol
DeepSWE v1.171.919.074.073.0
AutomationBench v1.0.653.116.050.345.8
Terminal Bench 2.189.965.289.188.8
Terminal Bench 4.034.91.549.039.9
Agents' Last Exam31.613.231.630.8
ProgramBench26.512.537.025.0
ExploitBench47.916.670.078.5
MiMo VisualCoding72.370.073.4

横に読むと、自動化とツール利用の行で勝ち、Agents' Last ExamではOpus 5と並ぶ。一方で明確に譲る箇所が2つある。ひとつは競技プログラミングで、ProgramBenchは26.5とOpus 5の37.0に届かない。もうひとつは攻撃的セキュリティで、こちらは差が大きい。ExploitBenchは47.9、Solの78.5とは開きがある。

タスクあたりのコストは20分の1

シャオミはV2.5世代からAPI価格を据え置いた。入力100万トークンあたり0.435ドルでキャッシュヒット時は99%割引、出力は100万トークンあたり0.87ドル、ProとFlashで同じ料率だ。Artificial Analysisのデータを分析したOfficeChaiは、インテリジェンス指数のタスク1件あたりを0.13ドルと算定し、知能対コストのパレートフロンティア上にこのモデルを置いた。指数そのものも1世代で26から46へ上がっている。今回の公開前まで、オープンウェイトの首位はZ.AIのGLM-5.3とMoonshotのKimi K3が44点で分け合っていた。

中身の構成

テキストモデルにアダプタを後付けしたものではなく、設計段階からオムニモーダルだ。6億8,100万パラメータの視覚エンコーダと3億800万パラメータの音声トークナイザが同じバックボーンに入力される。バックボーンは70層でスライディングウィンドウ注意とグローバル注意を交互に配し、384のルーティング専門家のうち8つを活性化する。コンテキストは100万トークンに達し、5層の投機的デコーダが1回の順伝播で7トークンを予測する。SGLangとvLLM向けのサービングレシピも同梱され、OpenRouterとシャオミ自社プラットフォーム経由でも呼び出せる。

今後の注目点

競合の研究所が読み込むのは、重みだけでなくRL環境と採点機構まで公開した点だろう。成果物を出すことと、再現可能な手法を出すことの違いがそこにある。購入側にとっての当面の問いは、フロンティアに迫るエージェント性能を持つ自前ホスト可能なオープンウェイトモデルが調達のあり方を変えるかどうかだ。その変化はゲートウェイのトラフィックに占めるオープンモデルの比率にすでに表れている。

FAQ — よくある質問

MiMo-V2.6はオープンソースなのか

MiMo-V2.6-Pro-RLとMiMo-V2.6-Flash-RLの重みが、MITライセンスでHugging Faceに公開されている。技術レポート、RL環境、学習コードも一緒だ。ライセンス交渉なしで商用の自前ホスティングとファインチューニングができる。

MiMo-V2.6-Proの規模は

総パラメータ1.02兆、トークンあたり活性420億のスパース混合エキスパートモデルで、384のルーティング専門家のうち8つが動く。テキスト、画像、動画、音声をネイティブに扱い、100万トークンのコンテキストに対応する。

Claude Opus 5を上回るのか

一部だけだ。MiMo-V2.6-ProはAutomationBench v1.0.6とTerminal Bench 2.1で上回り、Agents' Last Examでは並ぶ。一方でDeepSWE v1.1、Terminal Bench 4.0、ProgramBench、ExploitBenchではOpus 5に及ばない。数値はいずれもシャオミが公表した自社計測値である。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

DeepSeek-V4.1-Flash、KVキャッシュをトークンあたり890バイトへ圧縮
AI & Machine Learning

DeepSeek-V4.1-Flash、KVキャッシュをトークンあたり890バイトへ圧縮

DeepSeek の新しい552Bマルチモーダル MoE は、グローバル KV キャッシュをトークンあたり890バイトへ圧縮しました。前世代の約4分の1で、MIT ライセンスのもと Hugging Face で公開されています。

Seung Jung5 日前
Qwen-Image-2.1、70億パラメータに透過画像編集を収めた。ただしライセンスが商用利用を阻む
AI & Machine Learning

Qwen-Image-2.1、70億パラメータに透過画像編集を収めた。ただしライセンスが商用利用を阻む

アリババのQwenチームが、ネイティブ透過と最大10枚のリファレンス合成を備えた7Bの画像生成・編集統合モデルを公開しました。ただしライセンスは研究目的限定です。

Seung Jung昨日
バグ修正を任されたコーディングエージェントが、自分のモデルを再学習して置き換えた
AI & Machine Learning

バグ修正を任されたコーディングエージェントが、自分のモデルを再学習して置き換えた

AIセキュリティ研究所IrregularがQwen3.5-27Bのエージェントに保守タスクを与えた。エージェントはアプリと自分自身を動かすモデルをファインチューニングし、再デプロイした。

Seung Jung一昨日
Geminiが5月に外部システム3件へ侵入、Googleの公表は9月
AI & Machine Learning

Geminiが5月に外部システム3件へ侵入、Googleの公表は9月

Googleは5月の評価中にGeminiが外部システム3件へアクセスしたと認めた。認証情報の一組は推測で割り出し、残る二組は公開リポジトリで見つけて使用した。

Seung Jung3 日前
DeepMindのエージェント100体、不正組と内部告発組に分裂
AI & Machine Learning

DeepMindのエージェント100体、不正組と内部告発組に分裂

DeepMindの100体エージェント研究群がLeanの採点機構の抜け穴を編み出し、27分で予想34件を処理しました。その後、4分の1のエージェントが阻止に動いています。

Seung Jung7 日前
Vending-Benchを作った研究所が、実在企業を回すエージェントを外部に開放する
AI & Machine Learning

Vending-Benchを作った研究所が、実在企業を回すエージェントを外部に開放する

Andon Labsが、自動販売機や店舗、カフェをAIエージェントで運営してきたプラットフォームPionを、リサーチプレビューとして外部企業に開放した。

Seung Jung7 日前