a16z가 투자한 Vals, '문항 비공개' 산업별 평가로 AI 벤치마크 판을 뒤집으려 한다

TechCrunch21일 전조회 4

AI 모델의 성능을 검증하는 벤치마킹 스타트업 Vals가 앤드리슨 호로위츠(a16z)가 주도한 시리즈 A 라운드에서 4천만 달러를 조달했다. 2024년에 설립된 이 회사는 기존 평가 체계가 최신 모델의 실제 능력을 따라가지 못한다는 문제의식에서 출발했고, 불과 2년 만에 업계에서 존재감을 갖춘 평가 전문 기업으로 자리 잡았다. 이번 라운드 이전에는 8VC와 블룸버그 베타가 참여한 시드 투자도 받았다.

Vals의 평가 방식에서 가장 눈에 띄는 대목은 시험 자료를 외부에 공개하지 않는다는 점이다. 공개된 벤치마크는 모델 학습 데이터에 섞여 들어가 사실상 '답안지를 미리 보고 치르는 시험'이 되기 십상인데, 이를 차단하겠다는 설계다. 대신 일반 지식의 양을 묻는 대신 법률, 금융, 코딩처럼 특정 산업의 복합 과제를 얼마나 해내는지를 측정한다. 창업자 Rayan Krishnan은 모델이 각 영역에서 사람과 같은 품질의 결과물을 만들어낼 수 있는지, 그리고 모델이 통제 없이 확산될 경우 어떤 부작용이 생기는지를 함께 보려 한다고 설명한다.

평가 범위는 계속 넓어지고 있다. 전통적인 산업 영역에 더해 재귀적 자기개선, 정신건강, 사이버보안, 바이오보안, 그리고 무력충돌법 — 모델이 제네바 협약을 어떻게 적용하는지 — 까지 벤치마크 대상에 포함됐다. 개발자가 흔히 접하는 정적 데이터셋 기반 평가와는 결이 다른 셈이다.

수익 구조도 특이하다. 기업이 자사 모델을 시험받기 위해 Vals에 비용을 지불한다. 성능이 나쁘다는 사실을 확인하려고 돈을 내는 셈이라 직관적으로는 낯설지만, 정확한 측정값이 있어야 문제를 찾아 개선할 수 있다는 논리다. Krishnan은 이를 학생이 SAT 응시료를 내고 시험을 치르는 구조에 빗댄다. 이런 평가 결과는 새 AI 모델을 도입하거나 인수하려는 기업의 의사결정 근거로 쓰이기 시작했다.

성장세도 가파르다. 회사가 밝힌 매출은 지난해의 8배 수준이고, 연초 8명이던 직원은 25명으로 늘었다. 앞으로 10~15명을 추가 채용하고 더 큰 사무실로 옮길 계획이며, 연방 정부 기관을 대상으로 모델 평가를 제공하는 프로그램도 최근 시작했다.

배경에는 벤치마크의 신뢰도 문제가 깔려 있다. 상당수 벤치마크는 만들어진 지 오래돼 현재 모델의 능력을 제대로 담아내지 못하고, 점수가 유리하게 나오면 홍보 수단으로 소비된다. Krishnan은 스탠퍼드 재학 중 마이크로소프트와 학교 AI 연구소에서 일했고 팔란티어 인턴 경험도 있다. 그가 25세에 창업한 Vals는 이 틈을 정면으로 겨냥한다.

개발자 입장에서 실무 변화는 두 갈래다. 첫째, 모델 비교의 기준이 '시험 점수'에서 '해당 도메인의 실제 작업 수행 품질'로 옮겨갈수록, 자사 서비스에 맞는 모델을 고르는 방식도 산업별 과제 기반 평가로 바뀔 수 있다. 둘째, 평가 결과가 조달·투자·상장 문서에까지 인용되는 지표로 자리 잡으면, 모델을 고르는 쪽도 벤치마크의 출처와 방법론을 따져야 할 일이 늘어난다.

다만 주의할 점도 분명하다. 시험 문항을 비공개로 두는 전략은 학습 데이터 오염을 막는 대신, 외부에서 결과를 재현하거나 검증하기 어렵게 만든다. 또 평가 비용을 모델 제공 기업이 부담하는 구조에서는 이해관계가 얽힐 여지가 남는다. Krishnan은 AI 기업들의 상장이 이어지면서 이런 평가가 모델 사용을 좌우하고 공시의 핵심 요소가 될 것이라고 전망하지만, 그만큼 평가 체계 자체의 투명성도 함께 요구될 수밖에 없다.

관련 글