단일 프롬프트를 여러 모델·여러 시점에 돌리는 LLM 벤치마크 'LLM Ass Bench' 공개
'LLM Ass Bench'라는 이름의 LLM 벤치마크가 해커뉴스에 올라왔다. 이 벤치마크의 핵심은 세 가지 축이다. 하나의 프롬프트, 여러 모델, 그리고 여러 날짜. 즉 고정된 단일 입력을 두고 여러 모델의 출력을 비교하되, 그 비교를 한 시점의 스냅샷으로 끝내지 않고 날짜를 달리해 반복 기록한다.
원문이 제시한 설명은 "One prompt, Multiple models, Multiple dates"라는 한 줄이 전부다. 어떤 모델들이 대상인지, 프롬프트의 내용은 무엇인지, 점수를 어떻게 매기는지, 결과가 공개된 날짜가 언제인지는 이 설명만으로는 알 수 없다. 확인 가능한 정보는 평가 방식이 대규모 문제 세트가 아니라 단일 프롬프트를 중심으로 짜여 있다는 점, 그리고 모델 축과 시점 축을 함께 둔다는 점이다.
기존 LLM 벤치마크는 수백에서 수천 개의 문항을 모아 총점을 매기고, 그 결과를 특정 시점의 리더보드로 굳히는 경우가 많다. 반면 실제 서비스에 쓰이는 모델은 이름은 그대로여도 가중치나 서빙 설정이 조용히 바뀌곤 한다. 날짜 축을 별도로 두는 구성은 같은 모델 이름이 시점에 따라 다른 답을 낼 수 있다는 문제의식에서 나온 것으로 보인다.
개발자 입장에서 이런 형태의 벤치마크가 주는 실용적인 힌트는 분명하다. 모델을 고를 때 총점 순위 하나에 의존하기보다, 자기 서비스에서 실제로 쓰는 프롬프트를 뽑아 여러 모델에 던지고 그 결과를 주기적으로 다시 확인하는 편이 낫다는 것이다. 단일 프롬프트 비교는 그런 자체 평가를 시작하는 가장 가벼운 형태이기도 하다.
다만 해석에는 주의가 필요하다. 프롬프트 하나에 대한 결과는 모델의 일반적인 성능을 대표하지 않는다. 프롬프트를 바꾸면 순위가 뒤집힐 수 있고, 날짜별 변화가 모델 업데이트 때문인지 서빙 환경 차이 때문인지도 이 정보만으로는 구분되지 않는다. 평가 기준과 대상 모델 목록, 원시 결과가 공개돼 있는지 확인한 뒤 참고하는 것이 안전하다.
관련 글
- 예산별 최적 LLM, 매일 다시 계산되는 가성비 프런티어Artificial Analysis의 무료 API를 매일 수집해 예산별 최적 LLM을 계산하는 '가성비 프런티어' 페이지가 공개됐다. 100만 토큰당 블렌디드 가격과 Intelligence Index를 대조해 일별 변동까지 한 표에서 보여준다.
- a16z가 투자한 Vals, '문항 비공개' 산업별 평가로 AI 벤치마크 판을 뒤집으려 한다AI 벤치마킹 스타트업 Vals가 앤드리슨 호로위츠가 이끄는 시리즈 A에서 4천만 달러를 유치했다. 시험 문항을 공개하지 않고 법률·금융·코딩 등 산업별 실무 과제로 모델을 평가해 기존 벤치마크의 한계를 겨냥한다.
- 샤오미 MiMo V2.6 공개, 오픈소스 중 AAI 지수 최상위권 주장MiMo V2.6이 공개됐다. 게시물에 따르면 Pro 버전이 AAI Index 46으로 오픈소스 모델 중 최상위권에 올랐고, 터미널·SWE 벤치마크에서는 경쟁 모델과 엇갈린 결과를 보였다. 가중치는 허깅페이스에 공개됐다.
- 필즈상 수상자 25인, "AI의 수학 문제 풀이 경쟁은 수학을 망친다" 공동 선언테렌스 타오를 포함한 필즈상 수상자 25명이 AI 기업의 수학 문제 풀이 벤치마크 경쟁이 수학 연구의 본질을 훼손한다는 공동 선언을 발표했다. LLM이 미해결 난제를 풀어내는 시대에 벤치마크와 평가 설계의 방향을 다시 묻는 계기다.