샤오미가 1조 200억 파라미터 MiMo-V2.6-Pro를 MIT 라이선스로 공개하고 Claude Opus 5와 같은 표에 올렸다
샤오미 MiMo 팀은 2026년 9월 21일 15시 39분(UTC) 허깅페이스에 MiMo-V2.6-Pro-RL과 MiMo-V2.6-Flash-RL을 MIT 라이선스로 공개했다. Pro는 총 1조 200억 개 파라미터 가운데 토큰당 420억 개만 켜는 희소 MoE이고, Flash는 3,090억 개 가운데 150억 개를 켠다. 두 모델 모두 컨텍스트 창 100만 토큰에 텍스트와 이미지와 영상과 음성을 한 모델에서 받는다. 모델 카드가 함께 실은 17행짜리 비교표는 Claude Opus 5와 GPT-5.6 Sol을 같은 칸에 세웠고, ASAP은 그 표를 행 단위로 다시 읽어 오픈웨이트 최상위라는 표현이 어디까지 성립하는지 정리한다.
공개된 것은 체크포인트 두 개와 강화학습을 한 번만 돌린다는 설계다
MiMo-V2.6 시리즈의 공식 설명은 "강화학습을 자기 개선 쪽으로 확장한다"는 한 줄로 시작한다. 샤오미가 내세운 핵심 설계는 도메인별로 강화학습을 따로 돌리지 않고 코딩과 일반 에이전트와 시각과 사이버보안을 한 번의 혼합 학습에 밀어 넣는 방식이며, 모델 카드는 이를 You Only RL Once로 부른다. 과제와 여러 하네스를 같은 배치에 섞어 능력끼리 서로를 강화하게 하고, 학습에서 본 적 없는 하네스로도 전략이 옮겨 가게 하는 것이 목적이다.
연산 규모도 카드에 적혀 있다. 완전 비동기 GRPO를 쓰고 한 스텝에 프롬프트 1,568개와 롤아웃 16개를 묶으며, 한 번의 갱신에 수십억 토큰이 들어간다. 여기에 보상 신호 자체를 키우는 두 장치가 붙는다. Groupwise Reward Synthesis는 서로 대비되는 롤아웃에서 과제별 채점 기준을 오프라인으로 만들어 테스트 결과와 합치고, Groupwise Advantage Redistribution은 통과한 궤적들을 온라인으로 순위 매겨 더 나은 풀이 쪽으로 이득을 옮긴다. 통과와 실패라는 이진 신호만으로는 통과한 답들 사이의 우열을 가릴 수 없다는 문제를 정면으로 겨냥한 구성이다.
구조 수치는 Pro 기준 70층이며 이 가운데 60층이 슬라이딩 윈도 어텐션, 10층이 전역 어텐션이다. 히든 크기는 6144, 라우팅 전문가는 384개이고 토큰당 8개가 켜지며, 공유 전문가는 두지 않는다. 시각 입력은 6억 8,100만 파라미터의 MiMo ViT가, 음성은 3억 800만 파라미터 AudioTokenizer와 1억 2,700만 파라미터 패치 인코더가 맡는다. 출력 속도를 위한 5층짜리 투기적 디코더는 한 번의 순전파로 뒤따르는 토큰 7개를 예측한다. Flash는 같은 설계를 48층과 히든 4096, 전문가 256개로 줄인 판이다.
표를 행 단위로 세면 Claude Opus 5를 넘는 칸은 14행 중 넷이다
샤오미가 제시한 비교표에서 MiMo-V2.6-Pro가 Claude Opus 5와 직접 맞붙는 행은 14개이고, 그중 Pro가 앞서거나 동률인 칸은 네 개다. AutomationBench v1.0.6에서 53.1점 대 50.3점, Terminal Bench 2.1에서 89.9점 대 89.1점, MiMo VisualCoding에서 72.3점 대 70.0점으로 앞서고, Agents' Last Exam은 31.6점으로 같다.
나머지 열 개 행은 Claude Opus 5가 가져간다. DeepSWE v1.1은 71.9점 대 74.0점, ProgramBench는 26.5점 대 37.0점, MiMo Code Bench는 63.2점 대 68.6점, Toolathlon-Verified는 76.9점 대 80.6점, GDPval-AA 2.1은 1,673 대 1,708, Terminal Bench 4.0은 34.9점 대 49.0점, OSWorld-Verified는 82.0점 대 83.4점, JobBench는 62.0점 대 65.7점이다. 사이버 항목의 간격은 더 크다. ExploitGym은 17.8점 대 22.1점, ExploitBench는 47.9점 대 70.0점이다.
같은 표에서 직전 세대와의 거리를 보면 그림이 뒤집힌다. MiMo-V2.5-Pro의 DeepSWE v1.1은 19.0점이었고 이번 판은 71.9점으로 52.9점 올랐다. Terminal Bench 4.0은 1.5점에서 34.9점, JobBench는 25.0점에서 62.0점, Toolathlon-Verified는 49.1점에서 76.9점, GDPval-AA 2.1은 1,107에서 1,673으로 올라갔다. MiMo Cyber Bench는 0.0점에서 80.2점이다. 한 세대 전 이 계열은 에이전트 과제에서 사실상 점수가 없었고, 지금은 프론티어 모델과 같은 표에 실려 열 개 행을 내주는 자리까지 왔다.
Terminal Bench 2.1의 89.9점과 4.0의 34.9점이 같은 모델에서 나온다
여기서부터는 ASAP의 해석이다. 같은 벤치마크의 두 판본이 한 모델에서 55.0점 차이로 갈린다는 사실이 이번 표에서 가장 많은 것을 말해 준다. MiMo-V2.6-Pro는 Terminal Bench 2.1에서 89.9점을 받아 Claude Opus 5의 89.1점과 GPT-5.6 Sol의 88.8점을 제쳤지만, 4.0에서는 34.9점으로 Claude Opus 5의 49.0점과 GPT-5.6 Sol의 39.9점에 모두 뒤진다.
같은 두 행에서 Claude Opus 5의 낙폭은 40.1점이고 GPT-5.6 Sol은 48.9점이다. MiMo의 55.0점이 셋 중 가장 크다. 낡은 판본에서 높고 새 판본에서 낮은 모양은 구형 하네스가 포화에 가까워졌다는 뜻이기도 하고, 공개된 과제 분포에 더 정확히 맞춰졌다는 뜻이기도 하다. 어느 쪽이든 실무 판단에 쓰기 좋은 행은 89.9점이 아니라 34.9점 쪽이다. 새 판본이 어려운 이유는 과제가 길고 중간 결과를 스스로 확인해야 하기 때문이고, 실제 업무는 그쪽을 닮았다.
표 자체의 구성도 읽을 대목이다. 17개 행 가운데 MiMo Code Bench와 MiMo Cyber Bench와 MiMo VisualCoding 세 개는 샤오미가 만든 벤치마크다. Pro가 Claude Opus 5를 앞선 네 칸 중 하나인 MiMo VisualCoding이 여기에 속한다. 자사 벤치마크를 공개하는 것 자체는 투명성 쪽이지만, 승패를 셀 때 같은 무게로 놓을 행은 아니다. 자사 벤치마크 세 개를 빼고 다시 세면 Claude Opus 5 대비 우위는 AutomationBench와 Terminal Bench 2.1 두 칸, 동률 한 칸으로 줄어든다.
사이버보안 행에서는 Flash가 Pro를 앞서는 칸이 나온다
사이버 항목 다섯 행은 이번 공개에서 가장 해석이 갈리는 구간이다. CyberGym에서 Flash가 95.1점으로 Pro의 94.0점을 앞서고, MiMo Cyber Bench에서는 Pro 80.2점과 Flash 77.2점으로 순서가 되돌아온다. 반면 ExploitGym은 Pro 17.8점과 Flash 6.0점, ExploitBench는 Pro 47.9점과 Flash 25.3점, SEC Bench Pro는 Pro 66.3점과 Flash 47.5점으로 격차가 크게 벌어진다.
이 분포가 뜻하는 바는 단순하다. 자동화된 취약점 탐색에 가까운 과제에서는 150억 개만 켜는 모델도 420억 개를 켜는 모델을 따라잡지만, 실제 익스플로잇을 완성하는 쪽으로 갈수록 격차가 두 배 가까이 벌어진다. 그리고 바로 그 어려운 쪽 행에서 MiMo 두 모델은 표에 실린 폐쇄형 모델 전부에 뒤진다. ExploitBench는 GPT-5.6 Sol 78.5점과 Claude Fable 5 78.0점과 Claude Opus 5 70.0점에 이어 Pro가 47.9점이다.
오용 관점에서 중요한 것은 순위가 아니라 라이선스다. 사이버보안을 강화학습 도메인에 명시적으로 넣은 모델이 MIT 라이선스로 가중치째 풀렸다는 점은 이번 공개의 구조적 변화다. MIT는 상업적 이용과 재배포와 수정을 모두 허용하고 사용처를 제한하는 조항이 없다. 많은 오픈웨이트 모델이 자체 라이선스에 사용 제한을 붙여 온 관행과 비교하면, 같은 능력이 훨씬 얇은 계약상 제약을 달고 나온 셈이다. 표에 적힌 점수가 아직 프론티어에 미치지 못한다는 사실과, 그 점수가 앞으로 미세조정으로 올라갈 수 있다는 사실은 함께 성립한다.
MIT 라이선스와 573.5기가바이트 사이의 거리가 실제 문턱이다
허깅페이스 저장소의 MiMo-V2.6-Pro-RL 가중치는 safetensors 132개 파일에 합계 573.5기가바이트다. 저장소 태그에 fp8과 8-bit가 붙어 있으니 이미 압축된 상태의 용량이 그렇다는 뜻이다. 라이선스가 무료라는 것과 실행이 가능하다는 것은 이 지점에서 갈린다.
모델 카드가 권장하는 SGLang 실행 명령은 텐서 병렬 16과 데이터 병렬 2, 전문가 병렬 16을 쓰고 노드 수를 2로 지정한다. vLLM 쪽 예시는 텐서 병렬 8이다. 즉 샤오미 자신이 제시한 기본 구성이 이미 다중 노드다. 여기에 컨텍스트 창 100만 토큰을 실제로 채우면 KV 캐시가 별도로 붙으므로, 사양표의 100만이라는 값과 한 요청에 쓸 수 있는 길이는 같은 숫자가 아니다.
한국 팀 입장에서 이 조합은 두 갈래로 갈린다. 망분리와 데이터 반출 제한이 걸린 금융과 공공과 제조 쪽에서는 MIT 라이선스에 100만 토큰 컨텍스트와 음성 및 영상 입력을 갖춘 모델이 드물다는 점이 크다. 반대로 573.5기가바이트를 두 노드에 올릴 인프라가 없는 팀에게 이번 공개의 실질적 의미는 자체 호스팅이 아니라 외부 제공처 경유다. 모델 카드는 Xiaomi MiMo Open Platform API와 OpenRouter를 비롯한 경로를 함께 적었고, 그 경우 남는 이점은 라이선스가 아니라 가격과 성능이다. 벤처비트는 Pro의 공식 API 단가를 100만 토큰당 입력 0.435달러와 출력 0.87달러로, Flash를 0.14달러와 0.28달러로 전했으나 모델 카드에는 단가가 적혀 있지 않다.
표의 모든 칸이 샤오미 환경에서 측정됐다는 제약은 그대로 남는다
검증 관점에서 남는 제약은 세 가지다. 첫째, 비교표의 Claude Opus 5와 GPT-5.6 Sol과 Claude Fable 5 점수는 샤오미가 자사 환경에서 측정해 실은 값이며 제3자 재현치가 아니다. 모델 카드는 각 경쟁 모델의 추론 설정이나 연산 예산을 항목별로 밝히지 않았다.
둘째, 빈칸이 적지 않다. CyberGym과 MiMo Cyber Bench 행에는 경쟁 모델 점수가 아예 없고, GDPval-AA 2.1의 Flash 칸과 OSWorld-Verified의 V2.5 칸도 비어 있다. 빈칸은 뒤졌다는 뜻도 앞섰다는 뜻도 아니지만, 표 전체를 한 줄로 요약하려는 시도를 막는다. 셋째, 공개 시점 기준 허깅페이스 저장소의 다운로드 집계는 0이고 좋아요는 Pro 291개와 Flash 292개다. 커뮤니티가 실제로 돌려 본 결과가 쌓이기 전의 숫자라는 뜻이며, 외부 재현치는 아직 이 표 바깥에 없다.
그래서 이번 공개를 한 문장으로 정리하면 이렇다. 샤오미는 한 세대 만에 에이전트 벤치마크 점수를 거의 0에서 프론티어 바로 아래까지 끌어올렸고, 그 결과를 MIT 라이선스로 풀었으며, 표 위에서 Claude Opus 5를 넘은 칸은 자사 벤치마크를 빼면 두 개다. 오픈웨이트에서 가장 앞서 있다는 표현과 프론티어를 따라잡았다는 표현 사이의 거리가 정확히 그 열 개 행이다.
출처: 허깅페이스 XiaomiMiMo/MiMo-V2.6-Pro-RL 및 MiMo-V2.6-Flash-RL 모델 카드, 허깅페이스 모델 API 메타데이터, 벤처비트 2026년 9월 21일 보도

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr