샤오미가 9월 21일 MiMo-V2.6-Pro-RL의 가중치를 MIT 라이선스로 공개했다. Flash 모델과 Qwen3.5 기반 9B 증류 모델, 기술 리포트, 학습에 쓴 강화학습 환경과 코드까지 함께 내놨다. 파라미터 1.02조 규모의 전문가 혼합(MoE) 모델로 토큰당 420억 개가 활성화된다. 다만 순위표의 자리보다 눈길을 끄는 것은 그 뒤에 있는 세대 간 점수 도약이다.
핵심 요약
- MiMo-V2.6-Pro는 Artificial Analysis 인텔리전스 지수에서 46점을 받았다. 오픈웨이트 모델 중 최고이며 GPT-5.6 Sol에 1점 뒤진다.
- 직전 모델 MiMo-V2.5-Pro는 DeepSWE v1.1에서 19.0, Terminal Bench 4.0에서 1.5를 받았다. 같은 시험에서 V2.6-Pro는 71.9와 34.9를 기록했다.
- API 가격은 그대로다. 입력 100만 토큰당 0.435달러, 출력 100만 토큰당 0.87달러로 Pro와 Flash가 같다.
진짜 뉴스는 상승폭이다
오픈웨이트 공개는 대개 폐쇄형 프런티어에 얼마나 근접했는지를 내세운다. 정작 정보량이 많은 쪽은 샤오미 자체 표에서 모델이 어디서 출발했는지 보여주는 열이다. 에이전트형 소프트웨어 엔지니어링에서 V2.5-Pro는 19.0에 그쳤지만 V2.6-Pro는 71.9에 닿는다. 가장 어려운 터미널 벤치마크에서 구모델은 1.5로 사실상 작동하지 않았고, 신모델은 34.9를 넘겼다. GDPval-AA 2.1의 전문 업무 Elo는 1,107에서 1,673으로 올랐다.
샤오미는 이를 "You Only RL Once"라고 이름 붙인 설계 하나의 결과로 설명한다. 영역별로 강화학습을 따로 돌리는 대신 코딩과 범용 에이전트, 비주얼, 사이버보안 과제를 여러 에이전트 하네스와 함께 같은 배치에 섞었다는 것이다. 능력끼리 서로를 강화하고, 학습 중 본 적 없는 하네스로도 전이된다는 가설에 따른 선택이다. 학습은 완전 비동기 GRPO로 진행했고 스텝당 프롬프트 1,568개와 롤아웃 16회를 썼다.
폐쇄형 프런티어와 견주면
| 벤치마크 | MiMo-V2.6 Pro | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1 | 71.9 | 19.0 | 74.0 | 73.0 |
| AutomationBench v1.0.6 | 53.1 | 16.0 | 50.3 | 45.8 |
| Terminal Bench 2.1 | 89.9 | 65.2 | 89.1 | 88.8 |
| Terminal Bench 4.0 | 34.9 | 1.5 | 49.0 | 39.9 |
| Agents' Last Exam | 31.6 | 13.2 | 31.6 | 30.8 |
| ProgramBench | 26.5 | 12.5 | 37.0 | 25.0 |
| ExploitBench | 47.9 | 16.6 | 70.0 | 78.5 |
| MiMo VisualCoding | 72.3 | — | 70.0 | 73.4 |
가로로 읽으면 자동화와 도구 사용 항목에서 앞서고 Agents' Last Exam에서는 Opus 5와 동점이다. 대신 두 지점에서 확실히 밀린다. 하나는 경쟁 프로그래밍으로, ProgramBench에서 26.5를 받아 Opus 5의 37.0에 못 미친다. 다른 하나는 공격형 보안이고 격차가 훨씬 크다. ExploitBench에서 47.9로 Sol의 78.5와 벌어진다.
과제당 비용은 20분의 1 수준
샤오미는 V2.5 세대의 API 가격을 그대로 유지했다. 입력 100만 토큰당 0.435달러에 캐시 히트 시 99% 할인, 출력은 100만 토큰당 0.87달러이며 Pro와 Flash가 같은 요율이다. Artificial Analysis 데이터를 분석한 OfficeChai는 인텔리전스 지수 과제당 비용을 0.13달러로 계산하며, 지능 대비 비용 파레토 프런티어에 이 모델을 올려놨다. 지수 점수 자체도 한 세대 만에 26에서 46으로 올랐다. 이번 공개 전까지 오픈웨이트 1위는 Z.AI의 GLM-5.3과 Moonshot의 Kimi K3가 44점으로 나눠 갖고 있었다.
내부 구조
텍스트 모델에 어댑터를 덧붙인 형태가 아니라 처음부터 옴니모달로 설계됐다. 6억 8,100만 파라미터 비전 인코더와 3억 800만 파라미터 오디오 토크나이저가 같은 백본으로 들어간다. 백본은 70개 층에서 슬라이딩 윈도 어텐션과 글로벌 어텐션을 번갈아 쓰고, 라우팅 전문가 384개 중 8개를 활성화한다. 컨텍스트는 100만 토큰까지 늘어나며, 5층 스페큘러티브 디코더가 순전파 한 번에 토큰 7개를 예측한다. SGLang과 vLLM용 서빙 레시피가 함께 제공되고 OpenRouter와 샤오미 자체 플랫폼으로도 호출할 수 있다.
지켜볼 지점
경쟁 연구소들이 주목할 대목은 가중치가 아니라 RL 환경과 채점 장치까지 공개했다는 점이다. 결과물 하나를 내놓는 것과 재현 가능한 방법을 내놓는 것의 차이다. 구매자 입장에서 당장의 질문은 프런티어에 근접한 에이전트 점수를 내는 자체 호스팅 오픈웨이트 모델이 조달 방식을 바꾸느냐다. 그 변화는 게이트웨이 트래픽에서 오픈 모델이 차지하는 비중에서 이미 드러나고 있다.
FAQ — 자주 묻는 질문
MiMo-V2.6은 오픈소스인가?
MiMo-V2.6-Pro-RL과 MiMo-V2.6-Flash-RL의 가중치가 MIT 라이선스로 Hugging Face에 올라와 있다. 기술 리포트와 RL 환경, 학습 코드도 함께 공개됐다. 라이선스 협상 없이 상업적 자체 호스팅과 파인튜닝이 가능하다는 뜻이다.
MiMo-V2.6-Pro의 규모는?
전체 파라미터 1.02조, 토큰당 활성 파라미터 420억의 희소 전문가 혼합 모델이다. 라우팅 전문가 384개 중 8개가 활성화된다. 텍스트와 이미지, 영상, 오디오를 네이티브로 처리하고 100만 토큰 컨텍스트를 지원한다.
Claude Opus 5를 앞서는가?
일부 항목에서만 그렇다. MiMo-V2.6-Pro는 AutomationBench v1.0.6과 Terminal Bench 2.1에서 앞서고 Agents' Last Exam에서는 동점이다. 반면 DeepSWE v1.1과 Terminal Bench 4.0, ProgramBench, ExploitBench에서는 Opus 5에 뒤진다. 모든 수치는 샤오미가 공개한 자체 측정값이다.






