샤오미 MiMo V2.6 공개, 오픈소스 중 AAI 지수 최상위권 주장

V2EX19일 전조회 4

MiMo V2.6이 공개됐다. V2EX에 올라온 게시물에 따르면 Pro 버전이 AAI Index에서 46을 기록해 오픈소스 모델 가운데 가장 높은 순위에 올랐다고 한다. 같은 게시물은 이 점수가 GLM 5.3의 45를 넘어서고 Grok 4.7과 같은 수준이라고 적고 있다. 모델 가중치는 허깅페이스의 XiaomiMiMo 컬렉션을 통해 배포되고 있으며, 공식 페이지도 함께 열려 있다.

코딩 계열 벤치마크에서는 모델별로 결과가 갈린다. 게시물이 제시한 Terminal Bench 4.0 점수는 34.9%로, DeepSeek V4.1 Flash의 26.8%는 앞서지만 Grok 4.7의 38%와 GLM 5.3의 42%에는 미치지 못한다. 소프트웨어 엔지니어링 작업을 겨냥한 DeepSWE 1.1에서는 71.9%를 기록해 Grok 4.7의 71.0%를 근소하게 넘었고, DeepSeek V4.1 Flash의 74.2%보다는 낮다. 요약하면 종합 지표에서는 앞서고, 개별 코딩 벤치마크에서는 경쟁 모델과 서로 앞서고 뒤지는 구도다.

게시자는 이번 릴리스에서 강화학습 학습을 며칠 만에 끝내고 곧바로 결과물을 내놓았다는 점을 강조했다. 다른 모델들의 일정이 계속 밀리는 상황과 비교하면서, 가격 조건을 감안하더라도 단순히 점수만 끌어올린 결과로 보기는 어렵다는 평가를 덧붙였다. 이는 게시자의 주관적 판단이며, 학습 비용이나 일정에 대한 구체적인 수치는 원문에 제시되지 않았다.

개발자 입장에서 주목할 지점은 가중치가 공개된다는 점이다. 자체 인프라에 올려 추론 파이프라인을 구성하거나, 도메인 데이터로 추가 학습을 시도할 수 있다. 벤치마크 구성도 실무와 가깝다. Terminal Bench는 터미널 환경에서의 명령 수행 능력을, DeepSWE는 실제 저장소 수준의 소프트웨어 엔지니어링 작업을 측정하는 지표로 쓰인다. 코딩 에이전트나 자동화 도구를 붙일 때 어떤 모델을 후보에 올릴지 판단하는 참고 자료가 된다.

다만 수치의 출처와 검증 수준은 분명히 해둘 필요가 있다. 여기 정리된 점수는 모두 V2EX 게시물에 적힌 값으로, 측정 조건이나 프롬프트 구성, 평가 하네스가 공개되지 않았다. AAI Index 역시 원문에 산출 방식 설명이 없어 널리 합의된 표준 지표로 보기는 어렵다. 순위 주장은 발표 측의 자체 평가로 한정해 읽는 것이 안전하며, 실제 도입을 검토한다면 공개된 가중치로 자체 태스크에서 다시 측정하는 절차가 필요하다.

관련 글