샤오미 MiMo-V3, 새 추론 아키텍처 HySparse2 공개
샤오미 MiMo 팀이 MiMo-V3에 적용되는 새 추론 아키텍처 HySparse2를 공개했다. 팀 책임자 Fuli Luo가 X를 통해 먼저 예고했고, 이후 샤오미 공식 채널이 전체 소개를 내놓는 방식으로 알려졌다. 겨냥하는 대상은 장기(long-horizon) 다중 턴 에이전트다.
발표에서 제시한 목표는 세 가지다. Prefill 연산량을 줄이고, KV 캐시 크기를 줄이고, 긴 문맥에서의 검색 정확도를 높이는 것. 비교 기준은 MiMo-V2.6에 쓰인 Hybrid SWA이며, 백만 토큰 규모에서의 상대적 이득을 계수 형태로 제시했다는 점이 언급됐다. 공개된 제목 수준의 요약에서는 KV 공유를 두 단계 끌어올리고 Prefill 연산을 절반으로 줄이는 효과가 강조됐다.
배경에는 장문맥 에이전트 서빙의 구조적 부담이 있다. 대화가 길어지고 턴이 반복될수록 KV 캐시는 계속 커지고, 매 턴마다 다시 도는 Prefill 연산은 지연과 비용으로 직결된다. 검색 정확도까지 함께 요구되는 구간이라, 캐시를 줄이면서 문맥 활용 능력을 떨어뜨리지 않는 절충이 설계의 핵심 쟁점이 된다.
개발자 입장에서 보면 이런 계열의 최적화는 같은 하드웨어로 더 긴 문맥과 더 많은 동시 세션을 감당할 수 있는지에 직결된다. KV 캐시가 줄면 메모리 여유가 생기고, Prefill이 줄면 첫 토큰 지연이 낮아진다. 다만 HySparse2가 어떤 어텐션 구조와 캐시 공유 규칙을 쓰는지, 기존 서빙 스택에 그대로 얹을 수 있는지는 이번 공개만으로 확인되지 않는다.
주의할 점도 분명하다. 지금 전해진 수치는 회사 측이 제시한 상대적 이득이며, 독립적인 재현이나 제3자 검증 결과는 확인되지 않았다. 원문 자체도 백만 토큰 구간 설명 이후가 온전히 전달되지 않아, 구체적인 계수와 측정 조건은 추가 자료가 나와야 판단할 수 있다.