MiMo-V2.6-Pro de Xiaomi lidera los modelos de pesos abiertos, y su antecesor sacaba 19 en DeepSWE

Una sola tanda de aprendizaje por refuerzo mixto llevó al modelo de 19,0 a 71,9 en DeepSWE v1.1 y de 1,5 a 34,9 en Terminal Bench 4.0, sin cambiar los precios de la API

|4 min de lectura0
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code

Xiaomi publicó el 21 de septiembre los pesos abiertos de MiMo-V2.6-Pro-RL con licencia MIT, junto a una variante Flash, una destilación de 9B construida sobre Qwen3.5, el informe técnico y los entornos de aprendizaje por refuerzo y el código de entrenamiento que hay detrás. La publicación pone al alcance de cualquiera un modelo de mezcla de expertos con 1,02 billones de parámetros —42.000 millones activos por token—, y el salto generacional que lo sustenta resulta más llamativo que el puesto en la tabla.

Claves del anuncio

  • MiMo-V2.6-Pro obtiene 46 puntos en el Índice de Inteligencia de Artificial Analysis, la marca más alta entre los modelos de pesos abiertos y a un punto de GPT-5.6 Sol.
  • Su antecesor MiMo-V2.5-Pro sacaba 19,0 en DeepSWE v1.1 y 1,5 en Terminal Bench 4.0; V2.6-Pro anota 71,9 y 34,9 en esas mismas pruebas.
  • Los precios de la API no cambian: 0,435 dólares por millón de tokens de entrada y 0,87 por millón de salida, tanto en Pro como en Flash.

La noticia está en la diferencia

Los lanzamientos de pesos abiertos suelen presumir de lo cerca que quedan de la frontera cerrada. La columna más reveladora de la propia tabla de Xiaomi es la que muestra de dónde partía el modelo. En ingeniería de software con agentes, V2.5-Pro llegaba a 19,0; V2.6-Pro alcanza 71,9. En el banco de pruebas de terminal más exigente, el modelo anterior era prácticamente inoperante con 1,5 y el nuevo supera los 34,9. En GDPval-AA 2.1, el Elo de trabajo profesional pasa de 1.107 a 1.673.

Xiaomi lo atribuye a una única decisión de diseño que llama "You Only RL Once": en lugar de ejecutar pasadas separadas de aprendizaje por refuerzo para cada dominio, mezcló en los mismos lotes tareas de programación, de agente general, visuales y de ciberseguridad, junto con varios harnesses de agentes. La hipótesis es que las capacidades se refuerzan entre sí y se transfieren a harnesses que el modelo nunca vio durante el entrenamiento. La tanda usó GRPO totalmente asíncrono con 1.568 prompts y 16 despliegues por paso.

Dónde queda frente a la frontera cerrada

PruebaMiMo-V2.6 ProMiMo-V2.5 ProClaude Opus 5GPT-5.6 Sol
DeepSWE v1.171,919,074,073,0
AutomationBench v1.0.653,116,050,345,8
Terminal Bench 2.189,965,289,188,8
Terminal Bench 4.034,91,549,039,9
Agents' Last Exam31,613,231,630,8
ProgramBench26,512,537,025,0
ExploitBench47,916,670,078,5
MiMo VisualCoding72,370,073,4

Leído en horizontal, el modelo gana en las filas de automatización y uso de herramientas y empata con Opus 5 en Agents' Last Exam, para después ceder terreno en dos puntos concretos. Uno es la programación competitiva: 26,5 en ProgramBench frente a los 37,0 de Opus 5. El otro es la seguridad ofensiva, y ahí la distancia es amplia: 47,9 en ExploitBench frente a 78,5 de Sol.

Una veinteava parte del costo por tarea

Xiaomi mantuvo los precios de la API de la generación V2.5 en 0,435 dólares por millón de tokens de entrada, con un descuento del 99% cuando hay acierto de caché, y 0,87 por millón de salida, con la misma tarifa para Pro y Flash. El análisis de OfficeChai sobre los datos de Artificial Analysis sitúa al modelo en 0,13 dólares por tarea del Índice de Inteligencia y dentro de la frontera de Pareto entre inteligencia y costo, con el propio índice escalando de 26 a 46 en una sola generación. Antes de este lanzamiento, el primer puesto entre los pesos abiertos lo compartían GLM-5.3 de Z.AI y Kimi K3 de Moonshot, ambos con 44.

Qué hay por debajo

La arquitectura es omnimodal de origen y no un modelo de texto con adaptadores añadidos: un codificador visual de 681 millones de parámetros y un tokenizador de audio de 308 millones alimentan el mismo tronco, que corre 70 capas alternando atención de ventana deslizante y global sobre 384 expertos enrutados, con ocho activos. El contexto llega al millón de tokens y un decodificador especulativo de cinco capas predice siete tokens por pasada. Se distribuyen recetas de servicio para SGLang y vLLM, y el modelo también se enruta a través de OpenRouter y de la propia plataforma de Xiaomi.

Qué queda por confirmar

Publicar los entornos de RL y la maquinaria de evaluación, y no solo los pesos, es la parte que los laboratorios rivales leerán con más atención: es la diferencia entre entregar un artefacto y entregar un método reproducible. Para quien compra, la pregunta inmediata es si un modelo de pesos abiertos autoalojable con resultados de agente cercanos a la frontera cambia las decisiones de compra, un giro que ya se nota en cuánto tráfico de gateway mueven hoy los modelos abiertos.

Preguntas frecuentes

¿MiMo-V2.6 es de código abierto?

Los pesos de MiMo-V2.6-Pro-RL y MiMo-V2.6-Flash-RL están publicados en Hugging Face con licencia MIT, junto con el informe técnico, los entornos de RL y el código de entrenamiento. Eso permite alojarlo y ajustarlo con fines comerciales sin negociar una licencia.

¿Qué tamaño tiene MiMo-V2.6-Pro?

Es un modelo disperso de mezcla de expertos con 1,02 billones de parámetros totales y 42.000 millones activados por token, repartidos en 384 expertos enrutados con ocho activos. Procesa texto, imagen, video y audio de forma nativa y admite un contexto de un millón de tokens.

¿Supera a Claude Opus 5?

Solo en algunos frentes. MiMo-V2.6-Pro aventaja a Opus 5 en AutomationBench v1.0.6 y Terminal Bench 2.1 y empata en Agents' Last Exam, pero queda por detrás en DeepSWE v1.1, Terminal Bench 4.0, ProgramBench y ExploitBench. Todas las cifras son las publicadas por la propia Xiaomi.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

DeepSeek-V4.1-Flash reduce la caché KV a 890 bytes por token
AI & Machine Learning

DeepSeek-V4.1-Flash reduce la caché KV a 890 bytes por token

El nuevo MoE multimodal de 552.000 millones de parámetros de DeepSeek comprime la caché KV global a 890 bytes por token, cerca de una cuarta parte de su antecesor, y llega a Hugging Face con licencia MIT.

Seung Junghace 5 días
Qwen-Image-2.1 mete la edición con transparencia en 7B parámetros. La licencia prohíbe el uso comercial.
AI & Machine Learning

Qwen-Image-2.1 mete la edición con transparencia en 7B parámetros. La licencia prohíbe el uso comercial.

El equipo Qwen de Alibaba publicó un modelo unificado de generación y edición de imágenes de 7B con transparencia nativa y composición de hasta 10 referencias, bajo una licencia solo para investigación.

Seung Jungayer
Le pidieron arreglar un bug y el agente reentrenó y reemplazó su propio modelo
AI & Machine Learning

Le pidieron arreglar un bug y el agente reentrenó y reemplazó su propio modelo

El laboratorio de seguridad en IA Irregular le dio una tarea de mantenimiento a un agente Qwen3.5-27B. El agente ajustó y volvió a desplegar el modelo que impulsaba tanto la aplicación como a sí mismo.

Seung Junganteayer
Gemini entró en tres sistemas externos en mayo y Google lo reveló en septiembre
AI & Machine Learning

Gemini entró en tres sistemas externos en mayo y Google lo reveló en septiembre

Google confirmó que Gemini accedió a tres sistemas externos durante una evaluación de mayo: adivinó un juego de credenciales y halló otros dos en un repositorio público.

Seung Junghace 3 días
Cien agentes de DeepMind se dividieron entre tramposos y denunciantes
AI & Machine Learning

Cien agentes de DeepMind se dividieron entre tramposos y denunciantes

El enjambre de 100 agentes de DeepMind ideó una falla en el evaluador de Lean que liquidó 34 conjeturas en 27 minutos, y luego una cuarta parte de los agentes se organizó para frenarlo.

Seung Junghace 7 días
El laboratorio detrás de Vending-Bench abre los agentes que dirigen sus empresas reales
AI & Machine Learning

El laboratorio detrás de Vending-Bench abre los agentes que dirigen sus empresas reales

Andon Labs abrió Pion, la plataforma con la que dirigió una máquina expendedora, una tienda y un café mediante agentes de IA, a empresas externas como vista previa de investigación.

Seung Junghace 7 días