Xiaomi publicó el 21 de septiembre los pesos abiertos de MiMo-V2.6-Pro-RL con licencia MIT, junto a una variante Flash, una destilación de 9B construida sobre Qwen3.5, el informe técnico y los entornos de aprendizaje por refuerzo y el código de entrenamiento que hay detrás. La publicación pone al alcance de cualquiera un modelo de mezcla de expertos con 1,02 billones de parámetros —42.000 millones activos por token—, y el salto generacional que lo sustenta resulta más llamativo que el puesto en la tabla.
Claves del anuncio
- MiMo-V2.6-Pro obtiene 46 puntos en el Índice de Inteligencia de Artificial Analysis, la marca más alta entre los modelos de pesos abiertos y a un punto de GPT-5.6 Sol.
- Su antecesor MiMo-V2.5-Pro sacaba 19,0 en DeepSWE v1.1 y 1,5 en Terminal Bench 4.0; V2.6-Pro anota 71,9 y 34,9 en esas mismas pruebas.
- Los precios de la API no cambian: 0,435 dólares por millón de tokens de entrada y 0,87 por millón de salida, tanto en Pro como en Flash.
La noticia está en la diferencia
Los lanzamientos de pesos abiertos suelen presumir de lo cerca que quedan de la frontera cerrada. La columna más reveladora de la propia tabla de Xiaomi es la que muestra de dónde partía el modelo. En ingeniería de software con agentes, V2.5-Pro llegaba a 19,0; V2.6-Pro alcanza 71,9. En el banco de pruebas de terminal más exigente, el modelo anterior era prácticamente inoperante con 1,5 y el nuevo supera los 34,9. En GDPval-AA 2.1, el Elo de trabajo profesional pasa de 1.107 a 1.673.
Xiaomi lo atribuye a una única decisión de diseño que llama "You Only RL Once": en lugar de ejecutar pasadas separadas de aprendizaje por refuerzo para cada dominio, mezcló en los mismos lotes tareas de programación, de agente general, visuales y de ciberseguridad, junto con varios harnesses de agentes. La hipótesis es que las capacidades se refuerzan entre sí y se transfieren a harnesses que el modelo nunca vio durante el entrenamiento. La tanda usó GRPO totalmente asíncrono con 1.568 prompts y 16 despliegues por paso.
Dónde queda frente a la frontera cerrada
| Prueba | MiMo-V2.6 Pro | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 71,9 | 19,0 | 74,0 | 73,0 |
| AutomationBench v1.0.6 | 53,1 | 16,0 | 50,3 | 45,8 |
| Terminal Bench 2.1 | 89,9 | 65,2 | 89,1 | 88,8 |
| Terminal Bench 4.0 | 34,9 | 1,5 | 49,0 | 39,9 |
| Agents' Last Exam | 31,6 | 13,2 | 31,6 | 30,8 |
| ProgramBench | 26,5 | 12,5 | 37,0 | 25,0 |
| ExploitBench | 47,9 | 16,6 | 70,0 | 78,5 |
| MiMo VisualCoding | 72,3 | — | 70,0 | 73,4 |
Leído en horizontal, el modelo gana en las filas de automatización y uso de herramientas y empata con Opus 5 en Agents' Last Exam, para después ceder terreno en dos puntos concretos. Uno es la programación competitiva: 26,5 en ProgramBench frente a los 37,0 de Opus 5. El otro es la seguridad ofensiva, y ahí la distancia es amplia: 47,9 en ExploitBench frente a 78,5 de Sol.
Una veinteava parte del costo por tarea
Xiaomi mantuvo los precios de la API de la generación V2.5 en 0,435 dólares por millón de tokens de entrada, con un descuento del 99% cuando hay acierto de caché, y 0,87 por millón de salida, con la misma tarifa para Pro y Flash. El análisis de OfficeChai sobre los datos de Artificial Analysis sitúa al modelo en 0,13 dólares por tarea del Índice de Inteligencia y dentro de la frontera de Pareto entre inteligencia y costo, con el propio índice escalando de 26 a 46 en una sola generación. Antes de este lanzamiento, el primer puesto entre los pesos abiertos lo compartían GLM-5.3 de Z.AI y Kimi K3 de Moonshot, ambos con 44.
Qué hay por debajo
La arquitectura es omnimodal de origen y no un modelo de texto con adaptadores añadidos: un codificador visual de 681 millones de parámetros y un tokenizador de audio de 308 millones alimentan el mismo tronco, que corre 70 capas alternando atención de ventana deslizante y global sobre 384 expertos enrutados, con ocho activos. El contexto llega al millón de tokens y un decodificador especulativo de cinco capas predice siete tokens por pasada. Se distribuyen recetas de servicio para SGLang y vLLM, y el modelo también se enruta a través de OpenRouter y de la propia plataforma de Xiaomi.
Qué queda por confirmar
Publicar los entornos de RL y la maquinaria de evaluación, y no solo los pesos, es la parte que los laboratorios rivales leerán con más atención: es la diferencia entre entregar un artefacto y entregar un método reproducible. Para quien compra, la pregunta inmediata es si un modelo de pesos abiertos autoalojable con resultados de agente cercanos a la frontera cambia las decisiones de compra, un giro que ya se nota en cuánto tráfico de gateway mueven hoy los modelos abiertos.
Preguntas frecuentes
¿MiMo-V2.6 es de código abierto?
Los pesos de MiMo-V2.6-Pro-RL y MiMo-V2.6-Flash-RL están publicados en Hugging Face con licencia MIT, junto con el informe técnico, los entornos de RL y el código de entrenamiento. Eso permite alojarlo y ajustarlo con fines comerciales sin negociar una licencia.
¿Qué tamaño tiene MiMo-V2.6-Pro?
Es un modelo disperso de mezcla de expertos con 1,02 billones de parámetros totales y 42.000 millones activados por token, repartidos en 384 expertos enrutados con ocho activos. Procesa texto, imagen, video y audio de forma nativa y admite un contexto de un millón de tokens.
¿Supera a Claude Opus 5?
Solo en algunos frentes. MiMo-V2.6-Pro aventaja a Opus 5 en AutomationBench v1.0.6 y Terminal Bench 2.1 y empata en Agents' Last Exam, pero queda por detrás en DeepSWE v1.1, Terminal Bench 4.0, ProgramBench y ExploitBench. Todas las cifras son las publicadas por la propia Xiaomi.






