샤오미 MiMo-V2.6이 RL 컴퓨트 확장으로 자기개선 경로를 제시한다

MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement

HF Daily2610.11959

Core Team, Zongming Qiao, Ziyue Hua2026-10-08

무엇인가

이 보고서가 다루는 문제는 재귀적 자기개선(RSI)이다. 모델이 지속적인 탐색과 피드백으로 능력을 확장하려면, 모델을 상호작용 환경과 묶어 다단계 궤적과 피드백 신호를 공급하는 에이전트가 필요하다. 저자들은 복잡한 에이전트 과제에 대한 RL을 확장하는 것이 그 구체적 경로라고 본다. 다만 두 가지 장벽이 있다. 첫째, 기반 모델에 적합한 아키텍처와 에이전트가 탐색할 충분히 풍부한 공간이 필요하다. 둘째, RL 확장에는 인프라·환경·채점기 각각에 대한 정교한 해법이 필요하다. 이 보고서는 MiMo-V2.6-Pro(1.02T 파라미터 MoE, 활성 42B)와 MiMo-V2.6-Flash(310B MoE, 활성 15B) 두 모델로 이 간극을 메우려 한다.

어떻게 동작하나

기반은 아키텍처와 사전학습, 중간학습(mid-training)이 함께 만든다. 텍스트 백본은 지역 슬라이딩 윈도우 어텐션(SWA, 윈도우 128)과 전역 어텐션(GA)을 교차 배치한 하이브리드 블록을 쌓는다. 각 하이브리드 블록은 N개의 연속 SWA 블록 뒤에 GA 블록 하나가 오는 구조이고, 첫 블록만 전역 어텐션과 조밀 FFN을 써서 초기 표현 학습을 안정화한다. SWA·GA 블록 모두 공유 전문가 없는 희소 MoE FFN을 쓰며, SWA와 조밀 FFN 기반의 다중 토큰 예측(MTP)도 결합한다. 비전 인코더 MiMo-ViT는 고정 비중첩 윈도우 어텐션을 sink-augmented SWA로 바꾸고, 지역 SWA 층에서 행 우선·열 우선 토큰 직렬화를 번갈아 써 두 공간 축으로 정보를 전파한다. 4T 이미지 토큰 이상을 대조학습 같은 보조 목표 없이 교차엔트로피만으로 사전학습했다. 오디오는 2천만 시간 분량으로 학습한 토크나이저가 20층 RVQ로 프레임당 20개 토큰을 만들고, 4프레임을 묶은 패치 인코더가 25Hz를 6.25Hz로 낮춘다. 추론 가속용 드래프터는 DFlash의 블록 확산 설계를 따른 5층 Transformer로, 한 번의 순전파에서 이후 7개 토큰을 예측한다. 사전학습은 텍스트 전용 1단계와 옴니모달 공동 2단계로 진행되며 Flash는 48T(텍스트 26T+옴니 22T), Pro는 30T(27T+3T) 토큰을 소비하고 컨텍스트는 32K에서 256K로 확장된다. 중간학습에서는 에이전트 중심 데이터 혼합으로 256K를 거쳐 1M 컨텍스트까지 늘리고, 은닉 가중치 행렬에 한해 Muon 변형인 Muown으로 옵티마이저를 바꾼다(임베딩·LM 헤드·MoE 라우터는 AdamW 유지). 저자들은 이 전환에서 손실 스파이크가 한 번도 없었다고 밝히며, MXFP4 양자화 인식 학습도 이 단계에 넣는다.

무엇과 다른가

RL 확장은 세 축으로 이뤄진다. 첫째는 학습 연산량이다. 단일 실행에서 수천 개 GPU를 쓰며 MiMo-V2.6-Pro에 260만 달러, Flash에 90만 달러를 RL 후학습에 지출했다. 배치는 프롬프트 1,568개에 그룹 크기 G=16으로, 스텝당 2만 5천 개 시퀀스와 2.7~3.7B 토큰(시퀀스당 약 11만~15만 토큰)을 롤아웃하고 컨텍스트는 최대 1M까지 간다. Pro 기준 비용은 롤아웃 43.8%, 학습 43.5%, 채점기 12.7%로 나뉜다. 긴 꼬리를 처리하려고 부분 롤아웃을 써서 진행 중 시퀀스를 중단했다가 다음 롤아웃 단계에서 재개하고, 정책 갱신마다 KV 캐시를 다시 채우는 re-prefill 비용은 큰 배치로 상쇄한다. 학습-추론 일관성은 R3(라우팅 리플레이)와 top-p 샘플링 후보 집합 리플레이로 맞추고, 전부 통과하거나 전부 실패한 그룹을 걸러내는 동적 샘플러와 태스크별 표본 구성을 안정화하는 Sample Mixer를 둔다. 둘째는 환경과 하네스의 다양성·복잡도다. 코딩 과제는 GitHub PR/이슈 기반 합성, 사내 실제 개발 요청, 명세 기반 생성, CodeMidas를 이용한 소스코드 기반 합성, 장기 소프트웨어 엔지니어링 과제의 다섯 경로로 만든다. 감독 품질은 명세-테스트 정렬, 과제당 4회 롤아웃을 받은 감사 에이전트의 판정 비교(통과했지만 틀렸다고 판단되면 거짓 양성, 실패했지만 맞다고 판단되면 거짓 음성으로 표시), 참조 패치 적용 전 F2P 실패·P2P 통과와 적용 후 둘 다 통과가 8회 재실행에서 유지되는지 확인하는 안정성 검사로 관리한다. 일반 에이전트 환경은 실제 파일과 로컬 소프트웨어 목을 조합해 네트워크 변동 없이 재현 가능한 샌드박스로 만들고, 시각 산출물과 사이버보안 도메인까지 확장한다. 셋째는 채점 연산이다. 이진 통과/실패 대신 그룹 내 해답들을 서로 비교해 문제 해결 품질과 행동을 구분하는 groupwise agentic grading을 도입하고, Groupwise Reward Synthesis(GRS)와 Groupwise Advantage Redistribution(GAR)로 그 세밀한 구분을 학습 신호로 바꾼다. 이 신호는 모델을 더 정확하면서 더 짧고 토큰 효율적인 해법으로 유도한다. 대규모 안정성을 위해 MoE 라우터를 동결하고 리워드 해킹에 대한 다층 방어를 세운다.

어떻게 쓰나

결과는 여러 벤치마크에서 스텝이 늘수록 꾸준히 개선되는 형태로 제시된다. DeepSWE 평균@3는 MiMo-V2.6-Pro가 58.4에서 72.6으로, Flash가 48.7에서 65.7로 올랐다. 개선은 코딩에 국한되지 않고 AutomationBench(일반 워크플로), MiMo Visual Coding(시각), MiMo Cyber Bench(사이버보안)에서도 일관되게 나타난다고 저자들은 주장한다. 공개 자원 실험에서는 Qwen3.5-9B를 MiMo 생성 데이터(총 774억 토큰, 그중 손실 토큰 272억)로 지도 미세조정한 MiMo-V2.6-Distill-Qwen-9B가 SWE-bench Pro에서 32.0에서 44.6으로, AutomationBench에서 5.0%에서 30.3%로 향상됐다. 이 체크포인트를 공통 초기값으로 코딩·사이버보안·일반·시각 도메인에 GRPO를 각각 적용했고, 웹 개발 사례 연구에서는 정성적 결과와 함께 61.7 → 64.0 → 72.4의 점수 궤적을 보고한다. 인프라 쪽 수치도 있다. RL 롤아웃에 블록-6 DFlash를 기본으로 쓰면 MTP 구성보다 평균 수용 길이가 31.3% 높고, 블록-8 대비 전역 평균 처리량이 약 6% 개선되며, FP8 드래프트 연산으로 장문맥 워크로드에서 노드당 처리량이 약 10.3% 올라간다.

전제와 한계

개발자 관점에서 이 보고서의 실용적 가치는 알고리즘 아이디어보다 운영 파이프라인의 구체성에 있다. 롤아웃·채점·학습의 비용 비율(43.8/12.7/43.5)은 자체 RL을 설계할 때 어디에 GPU 예산을 배분해야 하는지 감을 준다. 학습 엔진과 추론 엔진 사이의 MoE 라우팅·top-p 정규화 불일치를 리플레이로 맞추는 방식, KV 캐시를 GPU 시간에는 HBM에 두고 도구 대기 시간에는 pinned 호스트 풀로 내리는 계층 캐싱, 전부 통과/전부 실패 그룹 필터링과 부분 롤아웃 조합은 그대로 차용 가능한 패턴이다. 또한 채점기를 이진 판정에서 그룹 내 상대 비교로 바꾸는 발상은, 정답이 하나로 정해지지 않는 웹 개발·문서 작업 같은 과제에서 보상 신호를 어떻게 만들지에 대한 답을 준다. 공개된 MiMo-V2.6-Distill-Qwen-9B, 약 7천 개 규모의 코딩·사이버보안·일반·시각 RL 환경(음악 생성 약 1천 개 별도), 엔드투엔드 RL 프레임워크, 조합 가능한 미니 하네스를 쓰면 재현 실험의 출발점을 직접 확보할 수 있다.

한계와 전제는 명시적 한계 절이 따로 있는 형태가 아니라 본문 곳곳에 흩어져 있다. 저자들 스스로 리워드 해킹을 주요 위협으로 규정하고 MoE 라우터 동결과 다층 방어를 별도로 설계했다는 점은, 대규모 RL에서 보상 신호가 오염될 위험이 상존한다는 전제를 깔고 있다. 코딩 과제 감사도 과제당 4회 롤아웃과 8회 재실행이라는 표본 수준의 검사이므로 모든 명세-테스트 불일치를 잡는다고 보장하지 않는다. 일반 에이전트 환경은 로컬 목과 샌드박스로 재현성을 얻는 대신 실제 외부 서비스의 변동성과 한계를 의도적으로 배제한다. 성능 수치 중 MiMo Code Bench·Cyber Bench·General Bench·Visual Coding은 내부 평가 세트이므로 독립 검증이 아니며, RL 후학습 비용이 Pro 260만 달러·Flash 90만 달러라는 점은 이 규모의 확장이 소수 조직에만 가능한 실험임을 시사한다. 원문에는 별도의 한계 절이나 실패 사례 분석이 제시되지 않았고, 학습 동역학·환경·프레임워크를 공개한다는 서술 외에 재현 결과의 외부 보고는 포함되지 않는다.