VoxCPM
무엇인가
TTS 파이프라인에서 텍스트→이산 토큰→오디오로 이어지는 중간 토큰화 단계를 제거한 음성 합성 모델이다. MiniCPM-4 백본 위에 2B 파라미터로 구성되고 200만 시간 이상의 다국어 음성 데이터로 학습됐다. 가중치와 코드는 Apache-2.0으로 공개돼 상업적 사용이 가능하다.
어떻게 동작하나
합성은 AudioVAE V2의 잠재 공간에서 LocEnc → TSLM → RALM → LocDiT 네 단계로 진행된다. LocEnc가 텍스트를 인코딩하고 TSLM과 RALM이 자기회귀적으로 잠재 표현을 이어가며 LocDiT가 확산 방식으로 음성을 복원한다. AudioVAE V2는 인코더와 디코더를 비대칭으로 설계해 16kHz 참조 오디오를 입력받아 48kHz 출력을 만들고, 별도 업샘플러 없이 초해상도를 내장한다.
무엇과 다른가
코덱 토큰을 쓰는 TTS와 달리 양자화로 인한 정보 손실이 없다. 서빙 경로는 두 갈래다. 다중 테넌트 서버는 vLLM-Omni가 PagedAttention KV 캐시와 연속 배칭으로 처리하고 OpenAI 호환 /v1/audio/speech 엔드포인트를 노출한다. 파이썬 없는 엣지 배포는 llama.cpp 기반 C++ 엔진 llama.cpp-omni가 GGUF 가중치로 CPU·Metal·CUDA·Vulkan에서 실행한다.
어떻게 쓰나
Python 3.10 이상에서 Python API, CLI, 웹 데모로 실행한다. GGUF 경로는 BaseLM(F16 또는 Q8_0)과 Acoustic 파일 두 개가 필요하고, CMake가 macOS에서 Metal, NVIDIA GPU가 있는 Linux에서 CUDA를 자동 감지해 빌드한다. 실행 플래그로 --cfg(가이던스 스케일), --timesteps(CFM 스텝), --seed, --temperature, --stream을 지정한다.
전제와 한계
지원 언어는 30개이며 언어 태그 없이 입력 텍스트만으로 합성한다. 중국어 방언으로 쓰촨어, 광둥어, 우어, 둥베이어, 허난어, 산시어, 산둥어, 톈진어, 민난어를 포함한다. Voice Design은 참조 오디오 없이 자연어 설명만으로 새 목소리를 만들고, Controllable Cloning은 짧은 참조 클립에 스타일 지침을 덧붙인다. Ultimate Cloning은 참조 오디오와 그 대본을 함께 요구한다. RTF는 RTX 4090에서 약 0.3, Nano-vLLM·vLLM-Omni 가속 시 약 0.13, Apple M4 Pro/Metal의 Q8_0 GGUF에서 약 1.76이다.
관련 논문 2
유사 도구
- fish-speech80개 이상 언어, 1천만 시간 오디오로 학습한 다국어 TTS 모델이다. Dual-AR 구조와 RL 정렬로 자연어 태그 기반 운율·감정 제어를 지원한다.
- ChatTTSLLM 어시스턴트 대화 장면을 겨냥해 중국어·영어 음성을 합성하는 자기회귀 TTS 모델이다. 웃음·쉼·감탄사를 토큰 단위로 제어한다.
- sherpa-onnx음성 인식·합성·화자 분리·VAD·음원 분리를 ONNX Runtime 위에서 인터넷 없이 실행하는 C++ 추론 엔진이다. 12개 언어 바인딩과 NPU 백엔드를 포함한다.
- openai-edge-ttsOpenAI TTS 엔드포인트를 흉내 내는 로컬 음성 합성 API 서버다. edge-tts를 백엔드로 써서 무료로 mp3·opus 등 오디오를 생성한다.