ElevenLabs, 220억 달러 가치 인정…음성 AI의 '대화형 튜링 테스트'를 노린다

TechCrunch16일 전조회 7

텍스트를 사람 목소리처럼 읽어주는 모델을 만드는 ElevenLabs가 투자자들로부터 220억 달러 가치를 인정받았다는 보도가 나왔다. 창업 4년 된 회사이며, 연간 반복 매출(ARR)은 6억 달러 규모로 성장했다고 회사 측은 밝힌다. 공동창업자이자 CEO인 마티 스타니셰프스키는 토론토의 창업 컨퍼런스 Nrth에서 짧은 인터뷰를 진행했다.

매출 구성을 보면 절반 이상인 55% 이상이 전통적인 엔터프라이즈 고객에서 나온다. 나머지 45% 가운데 상당 부분은 중소기업과 개발자, 빌더, 크리에이터다. 크리에이터 쪽은 오디오북과 더빙, 음악 제작에 이 플랫폼을 쓴다. 대표적인 엔터프라이즈 사례로는 Klarna가 미국 고객 3500만 명의 1차 전화 상담을 이 기술로 처리하고 있고, 도이치텔레콤과 시스코, 어도비, 그리고 여러 정부 기관도 고객 명단에 올라 있다. 대부분의 사용자는 상담원과 통화한다고 생각하지만 실제로는 이 회사의 음성 모델과 대화하고 있는 셈이다.

경쟁 구도는 단순하지 않다. 대화형 AI 플랫폼인 Decagon은 자사 음성 제품을 ElevenLabs로 학습시킨 뒤 이제는 같은 시장에서 경쟁하는 관계가 됐다. 스타니셰프스키는 모델 회사와 플랫폼 회사, 애플리케이션 회사의 경계가 과거처럼 명확하지 않다고 말한다. 모델 회사로 출발한 곳이 플랫폼을 거쳐 애플리케이션까지 넓히는 흐름이 일반화되고 있다는 설명이다.

기술 선택지도 이분법에서 멀어졌다. ElevenLabs는 고객이 '추론 레이어'를 여러 옵션 중에서 고르게 한다. 단순히 정보를 안내하는 상담이라면 지식베이스만 잘 갖추면 오픈웨이트 모델로도 충분한 경험을 만들 수 있다. 반면 금융 서비스처럼 본인 인증과 거래 내역, 환불 처리가 걸린 통화는 오류가 허용되지 않아 프런티어 모델이 앞선다는 것이 그의 판단이다. 오픈웨이트 모델 중에는 중국산도 포함되며, 미국 정부와 유럽 각국 정부가 고객인 만큼 배포마다 요구 조건이 달라진다.

구체적인 정부 사례도 언급됐다. 폴란드의 공공 의료 시스템에서는 예약 환자의 18%가 나타나지 않는 문제를 음성 에이전트가 전화로 알림을 주는 방식으로 다룬다. 이 경우 각국이 자체 지식으로 최적화한 모델을 쓰고, ElevenLabs는 데이터 레지던시를 유지한 채 통합하는 역할을 맡는다.

학습 데이터에 대해서는 양보다 주석 작업이 핵심이었다고 말한다. 내부적으로 수천 명의 계약 인력이 무엇을 말했는지뿐 아니라 언제, 어떻게, 어떤 감정으로 말했는지를 표시했고, 억양을 정확히 구분하기 위해 보이스 코치까지 투입했다. 고객사의 통화 데이터를 학습에 쓰는 경우도 있지만, 특정 기업과 함께 모델을 만든 사례에 해당한다는 설명이다.

개발자 입장에서 눈여겨볼 지점은 모델 선택의 유연성과 규제 대응이다. 음성 에이전트를 설계할 때 프런티어 모델과 오픈웨이트, 자체 파인튜닝 모델을 케이스별로 섞는 구성이 현실적인 선택지가 되고 있다. 모든 고객이 KYC 절차를 거치며, 에이전트가 스스로 다른 에이전트를 만들지 못하도록 설계해 자가 복제 위험은 차단한다고 회사는 설명한다. 매출총이익률은 구체적으로 공개하지 않았지만, 시장 점유율 확대를 위해서라면 마진이 더 낮아지는 것도 감수하겠다는 입장을 밝혀 향후 가격 경쟁 가능성을 시사했다.

한 가지 주의할 점은 이번 인터뷰가 짧은 대화를 압축한 형태라 수치의 세부 기준이 확인되지 않는다는 것이다. 2028년 기업공개(IPO) 관측에 대해서는 '향후 몇 년 안에 기반을 갖추겠다'는 수준의 답변만 나왔고 확정된 일정은 아니다. 또 현재 시점에서는 AI와 통화 중이라는 사실을 고지해야 한다는 입장이지만, 모두가 자기 에이전트를 쓰는 시기가 오면 사회적 기대가 달라질 것이라고 덧붙였다.