샤오미가 MiMo-V2.6 공개하며 RL 후처리 학습 비용 260만 달러를 밝혔다
샤오미 MiMo 팀이 10월 8일 공개한 기술 보고서에서 자체 모델 MiMo-V2.6의 강화학습 후처리 과정과 비용을 드러냈다. 보고서 제목은 "MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement"로, 에이전트 강화학습을 롤아웃(Rollout)·환경·채점기(Grader) 세 축에서 동시에 확장하는 방식을 다룬다. 공개된 모델은 MiMo-V2.6-Pro와 MiMo-V2.6-Flash 두 종류이며, 회사 측은 Pro의 RL 후처리 학습에 약 260만 달러, Flash에 약 90만 달러가 들었다고 밝혔다.
두 모델 모두 희소 전문가 혼합(MoE) 구조를 쓰고 텍스트 본체에 지역 슬라이딩 윈도우 어텐션(SWA)과 전역 어텐션(GA)을 섞었다. Pro는 전체 파라미터 1.02T에 추론 시 42B를 활성화하고, Flash는 전체 310B에 15B를 활성화한다. 학습 규모는 RL 스텝 하나당 프롬프트 1568개를 샘플링하고 각 프롬프트에서 롤아웃 16개를 생성해 약 2만5000개의 에이전트 궤적을 만드는 수준이다. 스텝당 토큰은 27억~37억 개, 궤적 하나의 평균 길이는 11만~15만 토큰이며 학습 컨텍스트는 최대 100만 토큰까지 늘어난다. 학습은 GRPO에 비동기 부분 롤아웃을 결합했고, 태스크 비중은 코드·경쟁 프로그래밍 68%, 범용 도구 사용 12%, 시각 디자인 13%, 컨텍스트 준수 3%, 사이버보안 4%다.
비용 구조에서 눈에 띄는 건 채점기 몫이다. Pro의 연산 비용 가운데 롤아웃이 43.8%, 파라미터 업데이트 학습이 43.5%, 에이전트 행동을 평가하는 채점기가 12.7%를 차지한다. Flash는 채점기 비중이 14.2%로 더 높다. 테스트 통과 여부만 1점·0점으로 매기는 기존 코드 RL 보상이 장기 에이전트 작업에서는 충분하지 않다는 판단에서, 같은 태스크의 여러 롤아웃을 묶어 평가하는 두 가지 방식을 넣었다. 그룹 단위 보상 합성(GRS)은 여러 해법을 비교해 "해법 품질"과 "행동 품질" 기준표를 만들고, 그룹 단위 이점 재분배(GAR)는 성공·실패 궤적을 함께 비교해 더 나은 해법에 더 많은 강화 신호를 배분한다. 성공했지만 같은 그룹의 다른 성공 해법보다 눈에 띄게 긴 궤적에 감점을 주는 길이 페널티도 함께 적용했다. 보상 해킹 차단책도 여러 겹이다. 학습 환경에서 빌드 로그, 검증기 출력, 잔여 패치, 바이너리, 바이트코드, 캐시를 지우고 지정된 버전 이전의 Git 이력만 남기며, 컨테이너 수준 네트워크 격리로 상위 수정본 접근을 막는다. 별도의 Hack Agent를 학습시켜 환경의 허점을 찾게 하고, 발견되면 환경을 고친 뒤 다시 공격시키는 과정을 반복한다. 학습 중에도 궤적을 오프라인 감사해 보상 해킹이 확인되면 해당 보상을 0으로 만든다. 보고서에 따르면 Pro와 Flash의 정식 학습에서 해킹이 확인된 궤적 비율은 2% 아래로 유지됐다.
에이전트 하네스 자체도 RL 확장 축으로 삼았다. 생산용 하네스를 그대로 섞는 대신 시스템 프롬프트·도구·컨텍스트 관리 같은 기본 기능만 남긴 작은 모듈형 mini-harness를 만들어 Code, General, Visual, Cyber 조합으로 학습했다. 그 결과 학습에 쓰지 않은 Codex, Claude Code, mini-swe-agent에서도 성능이 올랐고, DeepSWE v1.1에서 held-out 하네스 3종 평균 Pass@1이 약 50%에서 66%로 상승했다고 밝혔다. MoE router는 아예 동결했다. 고정하지 않으면 20 스텝 만에 9번째 레이어의 전문가 부하 변동계수가 0.78에서 2.0으로, 가장 바쁜 전문가 부하는 평균의 6배에서 16배로, 평균의 10% 미만인 cold expert 비율은 0.5%에서 22%로 치솟았다. 20스텝 모델의 router 파라미터만 RL 시작 전으로 되돌리면 부하가 정상화되고 벤치마크는 거의 영향받지 않았다. RL 전 구간에서 router를 동결한 뒤에는 변동계수 약 0.7, 최대 부하 평균의 5.5배, cold expert 약 1%로 유지되면서 성능은 계속 올랐다고 한다.
학습 인프라 이야기도 구체적이다. Pro는 30개 RL 스텝을 123.1시간에, Flash는 81.8시간에 마쳤다. GPU 이중 비트 오류(DBE), Flash의 15~16스텝 사이 Kubernetes 장애로 인한 Cyber 클러스터 파드 붕괴, Pro의 14스텝 이후 채점기 네트워크 단절로 인한 재시작이 있었다. 부분 롤아웃 재시작 후 짧은 작업이 먼저 끝나 남은 작업 길이를 과소평가하면서 GPU KV 풀과 고정 호스트 메모리 풀이 함께 가득 찼고, MoE 마이크로 배치 부하 불균형으로 특정 expert parallel rank가 평균의 30배 토큰을 받아 메모리가 터지기도 했다. 이를 위해 Ray Actor 기반 Harness Pool을 고정 수의 상주 Host Actor로 바꿔 프로세스·서비스 오버헤드를 줄이고, Payload Porter로 제어면과 데이터면을 분리해 무거운 데이터는 분산 스토리지에 두고 중앙 드라이버는 보상·길이·주소 같은 메타데이터만 다루게 했다. Sample Mixer는 목표 비율·통과율·소요 시간에 따라 동시성과 우선순위를 조정한다. 추론 최적화도 RL로 끌어와 지속 KV 캐시와 HBM에서 고정 호스트 메모리로의 오프로딩, Block-6 DFlash 투기적 디코딩을 적용했다. 기존 MTP-3 대비 평균 수용 길이가 31.3% 늘고, Block-6은 Block-8 대비 전체 처리량이 약 6% 높으며, FP8 초안 연산을 더하면 장문 컨텍스트에서 단일 노드 처리량이 기준선 대비 약 10.3% 올랐다고 한다.
학습 태스크 평균 통과율은 Flash와 Pro가 각각 약 25%, 12% 상대적으로 올랐다. 학습에 없는 DeepSWE v1.1에서는 Flash가 48.8에서 65.7로, Pro가 58.4에서 72.6으로 상승했다. 회사 측은 Pro가 Artificial Analysis Intelligence Index에서 46점을 받았고 대부분의 에이전트 벤치마크에서 Claude Opus 5, GPT-5.6 Sol과 비슷한 수준이라고 주장했지만, Claude Fable 5.1, GPT-6 Astra 같은 최상위 폐쇄 모델과는 격차가 있다고 인정했다. 컴퓨터 조작, 체화 지능, 과학 연구 태스크로도 확장한다고 밝혔다. 소프트웨어 엔지니어링·취약점 재현·지식 노동·웹 디자인 개발 등을 포함한 7000개 이상의 RL 환경과 verl, uni-agent, mini-swe-agent 기반 엔드투엔드 RL 프레임워크, 다중 하네스 학습용 경량 프레임워크를 함께 공개했다.
이 보고서의 값은 성능 수치보다 RL 파이프라인의 비용 구조와 실패 지점을 그대로 드러낸 데 있다. 채점기가 전체 연산의 12~14%를 먹는다는 점, MoE router를 동결해야 한다는 점, 롤아웃 데이터가 수 GB까지 커져 제어면과 데이터면을 분리해야 한다는 점은 자체 에이전트 RL을 돌리려는 팀이 바로 참고할 만한 제약이다. 다만 벤치마크 비교는 회사 측 자체 측정이고 일부 비교 대상 모델은 외부에서 검증된 결과가 아니므로, 그대로 받아들이기보다 보고서 원문과 공개된 환경을 직접 확인하는 편이 낫다.