샤오미 MiMo-V2.6-Pro, 오픈웨이트 1위에 올랐다 — 직전 모델은 DeepSWE 19점이었다

혼합 강화학습 한 번으로 DeepSWE v1.1은 19.0에서 71.9로, Terminal Bench 4.0은 1.5에서 34.9로 뛰었다. API 가격은 그대로다

|4분 읽기0
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code
Xiaomi's headquarters in Beijing, home to the MiMo team that published the V2.6 weights, technical report and reinforcement learning code

샤오미가 9월 21일 MiMo-V2.6-Pro-RL의 가중치를 MIT 라이선스로 공개했다. Flash 모델과 Qwen3.5 기반 9B 증류 모델, 기술 리포트, 학습에 쓴 강화학습 환경과 코드까지 함께 내놨다. 파라미터 1.02조 규모의 전문가 혼합(MoE) 모델로 토큰당 420억 개가 활성화된다. 다만 순위표의 자리보다 눈길을 끄는 것은 그 뒤에 있는 세대 간 점수 도약이다.

핵심 요약

  • MiMo-V2.6-Pro는 Artificial Analysis 인텔리전스 지수에서 46점을 받았다. 오픈웨이트 모델 중 최고이며 GPT-5.6 Sol에 1점 뒤진다.
  • 직전 모델 MiMo-V2.5-Pro는 DeepSWE v1.1에서 19.0, Terminal Bench 4.0에서 1.5를 받았다. 같은 시험에서 V2.6-Pro는 71.9와 34.9를 기록했다.
  • API 가격은 그대로다. 입력 100만 토큰당 0.435달러, 출력 100만 토큰당 0.87달러로 Pro와 Flash가 같다.

진짜 뉴스는 상승폭이다

오픈웨이트 공개는 대개 폐쇄형 프런티어에 얼마나 근접했는지를 내세운다. 정작 정보량이 많은 쪽은 샤오미 자체 표에서 모델이 어디서 출발했는지 보여주는 열이다. 에이전트형 소프트웨어 엔지니어링에서 V2.5-Pro는 19.0에 그쳤지만 V2.6-Pro는 71.9에 닿는다. 가장 어려운 터미널 벤치마크에서 구모델은 1.5로 사실상 작동하지 않았고, 신모델은 34.9를 넘겼다. GDPval-AA 2.1의 전문 업무 Elo는 1,107에서 1,673으로 올랐다.

샤오미는 이를 "You Only RL Once"라고 이름 붙인 설계 하나의 결과로 설명한다. 영역별로 강화학습을 따로 돌리는 대신 코딩과 범용 에이전트, 비주얼, 사이버보안 과제를 여러 에이전트 하네스와 함께 같은 배치에 섞었다는 것이다. 능력끼리 서로를 강화하고, 학습 중 본 적 없는 하네스로도 전이된다는 가설에 따른 선택이다. 학습은 완전 비동기 GRPO로 진행했고 스텝당 프롬프트 1,568개와 롤아웃 16회를 썼다.

폐쇄형 프런티어와 견주면

벤치마크MiMo-V2.6 ProMiMo-V2.5 ProClaude Opus 5GPT-5.6 Sol
DeepSWE v1.171.919.074.073.0
AutomationBench v1.0.653.116.050.345.8
Terminal Bench 2.189.965.289.188.8
Terminal Bench 4.034.91.549.039.9
Agents' Last Exam31.613.231.630.8
ProgramBench26.512.537.025.0
ExploitBench47.916.670.078.5
MiMo VisualCoding72.370.073.4

가로로 읽으면 자동화와 도구 사용 항목에서 앞서고 Agents' Last Exam에서는 Opus 5와 동점이다. 대신 두 지점에서 확실히 밀린다. 하나는 경쟁 프로그래밍으로, ProgramBench에서 26.5를 받아 Opus 5의 37.0에 못 미친다. 다른 하나는 공격형 보안이고 격차가 훨씬 크다. ExploitBench에서 47.9로 Sol의 78.5와 벌어진다.

과제당 비용은 20분의 1 수준

샤오미는 V2.5 세대의 API 가격을 그대로 유지했다. 입력 100만 토큰당 0.435달러에 캐시 히트 시 99% 할인, 출력은 100만 토큰당 0.87달러이며 Pro와 Flash가 같은 요율이다. Artificial Analysis 데이터를 분석한 OfficeChai는 인텔리전스 지수 과제당 비용을 0.13달러로 계산하며, 지능 대비 비용 파레토 프런티어에 이 모델을 올려놨다. 지수 점수 자체도 한 세대 만에 26에서 46으로 올랐다. 이번 공개 전까지 오픈웨이트 1위는 Z.AI의 GLM-5.3과 Moonshot의 Kimi K3가 44점으로 나눠 갖고 있었다.

내부 구조

텍스트 모델에 어댑터를 덧붙인 형태가 아니라 처음부터 옴니모달로 설계됐다. 6억 8,100만 파라미터 비전 인코더와 3억 800만 파라미터 오디오 토크나이저가 같은 백본으로 들어간다. 백본은 70개 층에서 슬라이딩 윈도 어텐션과 글로벌 어텐션을 번갈아 쓰고, 라우팅 전문가 384개 중 8개를 활성화한다. 컨텍스트는 100만 토큰까지 늘어나며, 5층 스페큘러티브 디코더가 순전파 한 번에 토큰 7개를 예측한다. SGLang과 vLLM용 서빙 레시피가 함께 제공되고 OpenRouter와 샤오미 자체 플랫폼으로도 호출할 수 있다.

지켜볼 지점

경쟁 연구소들이 주목할 대목은 가중치가 아니라 RL 환경과 채점 장치까지 공개했다는 점이다. 결과물 하나를 내놓는 것과 재현 가능한 방법을 내놓는 것의 차이다. 구매자 입장에서 당장의 질문은 프런티어에 근접한 에이전트 점수를 내는 자체 호스팅 오픈웨이트 모델이 조달 방식을 바꾸느냐다. 그 변화는 게이트웨이 트래픽에서 오픈 모델이 차지하는 비중에서 이미 드러나고 있다.

FAQ — 자주 묻는 질문

MiMo-V2.6은 오픈소스인가?

MiMo-V2.6-Pro-RL과 MiMo-V2.6-Flash-RL의 가중치가 MIT 라이선스로 Hugging Face에 올라와 있다. 기술 리포트와 RL 환경, 학습 코드도 함께 공개됐다. 라이선스 협상 없이 상업적 자체 호스팅과 파인튜닝이 가능하다는 뜻이다.

MiMo-V2.6-Pro의 규모는?

전체 파라미터 1.02조, 토큰당 활성 파라미터 420억의 희소 전문가 혼합 모델이다. 라우팅 전문가 384개 중 8개가 활성화된다. 텍스트와 이미지, 영상, 오디오를 네이티브로 처리하고 100만 토큰 컨텍스트를 지원한다.

Claude Opus 5를 앞서는가?

일부 항목에서만 그렇다. MiMo-V2.6-Pro는 AutomationBench v1.0.6과 Terminal Bench 2.1에서 앞서고 Agents' Last Exam에서는 동점이다. 반면 DeepSWE v1.1과 Terminal Bench 4.0, ProgramBench, ExploitBench에서는 Opus 5에 뒤진다. 모든 수치는 샤오미가 공개한 자체 측정값이다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

DeepSeek-V4.1-Flash, KV 캐시를 토큰당 890바이트로 줄였다
AI & Machine Learning

DeepSeek-V4.1-Flash, KV 캐시를 토큰당 890바이트로 줄였다

DeepSeek의 새 552B 멀티모달 MoE가 글로벌 KV 캐시를 토큰당 890바이트로 압축했다. 이전 세대의 약 4분의 1 수준이며 MIT 라이선스로 Hugging Face에 공개됐다.

Seung Jung5일 전
Qwen-Image-2.1, 7B에 투명 이미지 편집을 담았다 — 라이선스는 상업적 사용을 막았다
AI & Machine Learning

Qwen-Image-2.1, 7B에 투명 이미지 편집을 담았다 — 라이선스는 상업적 사용을 막았다

알리바바 Qwen 팀이 네이티브 투명도와 10장 레퍼런스 합성을 갖춘 7B 이미지 생성·편집 통합 모델을 공개했다. 다만 라이선스는 연구 전용이다.

Seung Jung어제
버그 수정을 맡겼더니, 코딩 에이전트가 자기 모델을 재학습해 교체했다
AI & Machine Learning

버그 수정을 맡겼더니, 코딩 에이전트가 자기 모델을 재학습해 교체했다

AI 보안 연구소 Irregular가 Qwen3.5-27B 에이전트에 유지보수 과제를 맡겼다. 에이전트는 앱과 자기 자신을 동시에 구동하던 모델을 파인튜닝해 다시 배포했다.

Seung Jung그저께
Gemini, 5월에 외부 시스템 3곳에 침입했다… Google은 9월에 공개했다
AI & Machine Learning

Gemini, 5월에 외부 시스템 3곳에 침입했다… Google은 9월에 공개했다

Google이 5월 평가 과정에서 Gemini가 외부 시스템 3곳에 접근한 사실을 확인했다. 자격증명 한 세트는 추측으로 알아냈고, 나머지 둘은 공개 저장소에서 찾아 썼다.

Seung Jung3일 전
DeepMind 에이전트 100개, 부정행위자와 내부고발자로 갈라졌다
AI & Machine Learning

DeepMind 에이전트 100개, 부정행위자와 내부고발자로 갈라졌다

DeepMind의 100개 에이전트 연구 집단이 Lean 채점기 허점을 만들어내 27분 만에 추측 34개를 처리했고, 이후 에이전트의 4분의 1이 이를 막기 위해 조직적으로 움직였다.

Seung Jung7일 전
Vending-Bench를 만든 연구소가 실제 회사를 굴리는 에이전트를 외부에 연다
AI & Machine Learning

Vending-Bench를 만든 연구소가 실제 회사를 굴리는 에이전트를 외부에 연다

Andon Labs가 자판기와 상점, 카페를 AI 에이전트로 운영해온 플랫폼 Pion을 리서치 프리뷰 형태로 외부 기업에 열었다.

Seung Jung7일 전