Mercury 2.5, 초당 770토큰으로 치고 나왔다…지능은 중간권·가격은 합격점

Hacker News17일 전조회 6

Artificial Analysis가 Mercury 2.5에 대한 지능·성능·가격 분석 결과를 내놨다. 이 모델은 추론(reasoning) 버전으로, 텍스트를 입력받아 텍스트를 출력하며 26만 토큰 규모의 컨텍스트 윈도우를 갖는다. 가장 눈에 띄는 숫자는 출력 속도다. 초당 770토큰을 뽑아내며, 같은 분석에서 이 항목은 '눈에 띄게 빠름'으로 분류됐다.

지능 지표는 속도만큼 화려하지 않다. Artificial Analysis Intelligence Index에서 12점을 받아 비교 대상 모델 중간값인 13점을 밑돌았다. 4단위 평가에서 지능은 2단위, 장황함(verbosity)도 2단위로 매겨졌다. 다만 장황함 점수는 긍정적으로 작용한다. 지능 지수 평가를 수행하는 동안 생성한 출력 토큰이 3500만 개로, 중간값 8500만 개에 비해 상당히 간결했다.

가격은 이 모델의 핵심 무기다. 입력 100만 토큰당 0.25달러, 출력 100만 토큰당 0.75달러로 책정됐다. 입력 단가 중간값이 0.25달러, 출력 단가 중간값이 0.92달러인 점을 감안하면 출력 쪽에서 특히 앞선다. 캐시 할인은 90%까지 적용되며, 지능 지수 태스크 하나를 평가하는 데 드는 평균 비용은 0.06달러로 집계됐다.

평가 기준이 된 Artificial Analysis Intelligence Index v4.3.2는 10개 평가를 묶은 것이다. AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1이 포함된다. 에이전트형 지식 노동, 실제 업무 과제, 터미널 기반 과학 연구 워크플로, 스프레드시트·문서 정량 분석, 쿠버네티스 장애 원인 분석 등 실무에 가까운 항목들이 섞여 있다.

개발자 입장에서 이 조합이 의미하는 바는 명확하다. 지능 최상위권을 노리는 모델이 아니라, 토큰을 대량으로 태우면서 지연과 비용을 눌러야 하는 자리를 겨냥한다. 초당 770토큰의 출력 속도는 스트리밍 응답의 체감 품질을 끌어올리고, 에이전트가 여러 단계를 순차적으로 밟는 구조에서 전체 완료 시간을 줄인다. 출력 토큰이 적게 나온다는 특성 역시 과금 구조상 그대로 절감으로 이어진다.

캐시 할인 90%는 반복되는 시스템 프롬프트나 고정 문서를 매 요청마다 다시 넣는 파이프라인에서 특히 유효하다. 같은 컨텍스트를 재사용하는 RAG·에이전트 구성이라면 실효 단가가 크게 낮아질 수 있다. 26만 토큰 컨텍스트는 A4 기준 약 390쪽 분량으로, 긴 문서를 통째로 넣는 용도까지 커버한다.

주의할 지점도 분명하다. 지능 지수가 비교군 중간값 아래라는 사실은 복잡한 다단계 추론이나 고난도 코딩·수학 과제에서 다른 모델에 밀릴 수 있음을 시사한다. 또한 이 페이지는 추론 버전을 다루며, 비추론 변형이 별도로 존재할 가능성이 열려 있다. 두 버전의 특성은 다르게 나타날 수 있으므로 실제 도입 전에는 자신의 워크로드로 직접 비교하는 편이 안전하다.

Artificial Analysis는 비교 공정성을 위해 모델 분류별로 기준을 달리 적용한다고 밝히고 있다. 비추론 모델은 비추론끼리, 추론 모델은 추론·비추론을 아우른 범위에서, 오픈 웨이트 모델은 같은 크기대의 오픈 웨이트끼리 비교된다. 독점 모델은 입력·출력 3:1 비율로 가중한 혼합 가격대를 기준으로 오픈 웨이트까지 포함해 비교된다. 순위를 읽을 때 이 전제를 함께 봐야 하는 이유다.

관련 글