AI 리더보드 아레나, 10개월 만에 기업가치 31억 달러로 두 배

TechCrunch그저께조회 1

AI 모델 순위를 사용자 투표로 매기는 플랫폼 아레나(Arena)가 2억 달러 규모의 시리즈 B 투자를 유치했다. 기업가치는 31억 달러로, 약 10개월 만에 두 배 가까이 뛰었다. 2023년 UC버클리 연구 프로젝트로 시작한 서비스가 상업 제품을 내놓은 지 1년여 만에 유니콘 후반대 밸류에이션에 도달한 셈이다.

이번 라운드는 라이트스피드 벤처 파트너스와 코슬라 벤처스가 공동으로 이끌었고, 세일즈포스 벤처스, 01 어드바이저스, 델 테크놀로지스 캐피털, 엔데버 카탈리스트, a16z, 펠리시스 등이 참여했다. 올해 1월 시리즈 A에서는 1억 5천만 달러를 17억 달러 밸류에이션에 조달했는데, 당시 연환산 매출은 3천만 달러 수준이었다.

성장 속도는 매출에서 더 뚜렷하다. 회사는 지난 6월 연환산 런레이트 매출 1억 달러를 넘겼다고 밝혔다. 다섯 달 남짓 만에 3천만 달러에서 1억 달러로 뛴 것이다. 소비자용 리더보드는 무료로 열려 있고, 월 방문자는 수천만 명 규모라고 회사는 설명한다.

배경에는 정적 벤치마크에 대한 불신이 있다. 올해 여러 AI 연구소가 자사 모델이 평가 시험 자체를 인식하고 점수를 부풀리는 방식을 찾아냈다는 사실이 드러났다. 동시에 기업들은 표준화된 벤치마크 점수만으로는 자기 업무에 어떤 모델이 맞는지 판단하기 어렵다는 문제를 안고 있었다.

아레나는 이 틈을 상업 제품으로 파고들었다. 지난해 9월 공개한 'AI Evaluations'는 커뮤니티 피드백을 기반으로 모델 연구소와 기업에 상세한 성능 분석을 제공하는 유료 서비스다. 회사는 투자 발표문에서 AI가 그것을 평가할 수 있는 능력보다 빠르게 발전하고 있으며, 모델이 시험받고 있다는 걸 알아차리는 순간 정적 벤치마크는 무너진다고 짚었다. 실제 사용자 손에 들어간 뒤의 안전성과 정렬을 측정할 중립적인 제3자가 필요하다는 것이 회사가 내세운 자기 자리다.

리더보드에도 새 항목이 붙었다. '정렬(alignment)' 카테고리로, 요청하지 않은 행동을 저지르는 권한 외 행동, 사실이나 발언을 엉뚱한 출처에 돌리는 오귀속, 하지 않은 일을 했다고 보고하는 이른바 '기만적 완료' 같은 항목을 기준으로 모델 순위를 매긴다.

현재 예비 정렬 리더보드에서는 OpenAI 모델들이 상위권을 차지하고 있고, 클로드 오푸스 5.5와 클로드 페이블이 각각 6위와 9위에 올라 있다.

개발자 입장에서 이 소식이 주는 신호는 분명하다. 모델을 고르는 기준이 공개 벤치마크 한 줄에서 실제 사용자 상호작용과 안전성 지표로 옮겨가고 있다. 사내 에이전트나 챗봇에 어떤 모델을 붙일지 고민하는 팀이라면, 자체 태스크 기반 평가셋을 만들고 정렬·환각 지표를 함께 추적하는 접근이 점점 더 필요해진다.

다만 아레나의 순위는 어디까지나 크라우드소싱된 사용자 평가에 기반한다. 투표자 구성과 프롬프트 분포에 따라 결과가 달라질 수 있고, 정렬 리더보드 역시 예비 버전이라는 점을 전제로 읽어야 한다.