StepAudio 3 Gen은 TTS·음악·효과음 RVQ AR 오디오 LLM이다.

StepAudio 3 Gen Technical Report

HF Daily2609.12945

Bin Lin, Bo Zhao, Boyang Wang2026-09-11조회 4

무엇인가

StepAudio 3 Gen은 제로샷 TTS, 보이스 디자인, 보컬, 효과음, 음악, 바이브 스피치, 여러 오디오 타입의 혼합을 하나의 프레임워크에서 다루는 범용 오디오 생성 모델을 주장한다. 기존에는 TTS, 텍스트-오디오, 텍스트-음악, 노래 합성이 각각 별도 트랙으로 발전해 표현, 조건 포맷, 생성 파이프라인이 호환되지 않았고, 최근 통합 모델은 연속 잠재 공간의 확산 또는 플로 매칭을 쓰거나 이산 단위를 언어모델처럼 다루는 두 갈래로 나뉘어 있었다. 이 논문은 후자를 택해 오디오를 RVQ 토큰 위에서 직접 자기회귀 모델링하고, 텍스트와 오디오를 하나의 인과 시퀀스로 섞어 LLM의 텍스트 지능을 유지하려 한다.

어떻게 동작하나

핵심 구성은 StepAudio Tokenizer와 LLM 백본이다. 토크나이저는 12.5Hz로 일반 오디오를 표현하고 16×2048 잔차 코드 공간을 공유하며, 24kHz 파형을 복원한다. SSL 인코더의 의미 특징과 SnakeBeta 활성화를 쓰는 합성곱 인코더의 50Hz 파형 수준 음향 특징을 채널 축으로 융합한 뒤 스트라이드 합성곱으로 12.5Hz로 압축하고 하나의 공유 양자화기로 이산화한다. 양자화는 16개 코드북, 코드북당 2048개 항목의 RVQ로 수행하고, 팩터화된 코사인 유사도 코드북 조회를 쓴다. 디코더는 RoPE와 25프레임 슬라이딩 윈도 어텐션을 쓰는 Vocos 스타일 Transformer와 ISTFT 헤드로 완전 인과적이어서 스트리밍 복원과 저지연 온라인 서비스를 노린다.

무엇과 다른가

LLM 백본은 사전학습된 디코더 전용 Transformer의 토큰 임베딩과 출력 어휘를 확장한다. 가장 거친 0번 코드북은 2048개의 연속 오디오 토큰으로 주 언어모델 어휘에 승격되어, 하나의 LM 헤드가 자연어 토큰과 최상위 오디오 코드를 함께 예측한다. 입력 쪽에서는 한 오디오 프레임의 16개 코드북이 각자 임베딩 테이블을 가지고, 16개 벡터를 합한 뒤 RVQ Adaptor를 통과한다. RVQ Adaptor는 사전 정규화와 SwiGLU를 쓰는 토큰별 잔차 블록 스택이며, 다운 프로젝션이 0으로 초기화되어 초기에는 항등 사상이 되고, 오디오 위치에만 더해져 텍스트 위치는 건드리지 않는다. 생성은 시간 축에서 LM 헤드가 0번 코드북을 자기회귀 예측하고, 4층 경량 인과 Transformer인 RVQ Code Predictor가 백본 은닉 상태와 0번 코드를 조건으로 1번부터 15번까지 코드북 축으로 자기회귀 예측한다. 손실은 L = L_tok + λ L_sp이고, L_sp는 15개 잔차 코드북에 대해 합산하므로 깊이 방향 손실이 토큰 손실보다 커질 수 있다.

어떻게 쓰나

학습은 간섭 인지 점진적 사전학습이라는 4단계로 진행된다. 1단계는 백본을 얼린 채 ASR과 음성-텍스트 번역 데이터로 입력측 오디오 임베딩과 어댑터만 학습하고 텍스트 출력만 감독한다. 어댑터 다운 프로젝션이 0 초기화라 초기에는 항등이고 백본이 얼어 있어 텍스트 능력 드리프트가 0이므로 텍스트 리플레이가 필요 없다고 주장한다. 2단계는 전체 모델을 풀고 오디오 이해 과제를 텍스트 코퍼스와 1대1로 섞어 학습하며 오디오 타깃은 아직 감독하지 않는다. 학습률은 2e-5 상수로 유지한다. 3단계는 생성 도입 단계로, 텍스트 대 TTS 대 인터리브 대화 비율을 3대1대2로 두어 텍스트가 50%, TTS가 마이크로배치의 1/6, 오디오 생성 스트림의 1/3을 차지한다. 이때 RVQ Code Predictor의 조건 입력을 백본 은닉 상태에서 분리(detach)해 15개 잔차 코드북 손실이 아직 무작위 초기화된 예측기를 통해 백본 표현을 흔들지 않게 한다. 4단계는 분리를 제거하고 λ를 1.0에서 0.1로 낮추며, 시퀀스 길이를 16,384에서 32,768로 늘린다. 12.5Hz에서 약 44분 오디오를 커버해 장편 합성과 다중 턴 대화를 겨냥한다.

전제와 한계

토크나이저 학습은 양자화기 드롭아웃 0.5, 의미 증류, GAN 프레임워크를 쓴다. 다중 주기 파형 판별기와 다중 해상도 스펙트럼 판별기, 특징 매칭, 다중 스케일 멜 스펙트로그램, 잔차 양자화 커밋먼트 손실로 자연스러움과 코드북 사용 안정성을 높인다. 약 70만 시간의 음성, 음악, 사운드 이벤트로 대규모 사전학습한 뒤, 인코더와 양자화기, 의미 분기를 얼리고 음향 디코더와 판별기만 갱신하는 디코더 전용 정제 단계를 거친다. LLM 사전학습은 약 2.7T 토큰을 소비하고, 생성 샘플은 텍스트 토큰 하나와 오디오 프레임 두 개를 인터리브한다. 후속 SFT는 약 5,000시간 오디오를 쓰고, 자연 대화형 TTS를 위해 1,500시간 음성을 별도로 큐레이션한다. 음성-보컬 쌍은 TTS 기반 음성 복제와 노래 음성 변환으로 의사 쌍을 만들고 Audiobox Aesthetics PQ/CE, SingMOS, 음색 유사도로 필터링한다. GRPO 기반 정책 최적화도 언급되며 DAPO식 동적 샘플링으로 그룹 보상 표준편차가 δ=0.02 미만인 그룹을 버리고, 학습률 1e-6에서 1e-7을 쓴다.

평가는 세 질문, 즉 RVQ Adaptor가 다중 코드북 오디오 표현을 LLM에 잘 통합하는지, 간섭 인지 점진적 사전학습이 텍스트 능력을 보존하는지, 생성 품질과 제어성이 강한지를 중심으로 구성된다. RVQ Adaptor 유무 비교는 AISHELL-1 테스트의 CER, LibriSpeech test-clean의 WER, MMAU 정확도, CoVoST BLEU, SpeechMMLU T2S 정확도로 평가했고, 원문은 표 2에서 어댑터를 쓴 시스템이 모든 지표에서 일관되게 더 낫다고만 밝힌다. 구체 수치는 제공된 본문에 제시되지 않았다. 텍스트 능력 보존은 3단계 베이스라인과 비교해 FinEval, C-Eval, MMLU, CMMLU, MATH, GSM8K, BBH, HumanEval에서 평가했고, 표 3에서 제안한 간섭 인지 점진적 사전학습이 모든 텍스트 벤치마크에서 더 낫다고 주장한다. 이 역시 구체 수치는 본문에 없다.

TTS는 중국어 인간 유사성 평가 세트에서 Arena 스타일 쌍대 비교로 평가했다. 총 1,500회 비교에서 StepAudio 3 Gen은 Elo 1755.33으로 가장 높았고, Qwen-Audio-3.0-TTS-Plus, Doubao-App, MiniMax-Speech-2.8-HD, Inworld-TTS-2, StepAudio 2.5 TTS 다섯 상용 시스템을 앞섰다. 상대별 100회 직접 비교에서 종합 승률 82.0%, 상대별 승률 73.0%에서 90.0%를 기록했다. 저자들은 CER과 화자 유사도 같은 객관 지표가 평탄한 운율도 낮은 CER을 낼 수 있고 화자 정체성과 음색만 반영한다며, 운율, 리듬, 표현력, 자연스러운 발화 행동을 담는 주관 평가를 선호한다고 밝힌다. 보이스 디자인은 InstructTTSEval 전체 벤치마크에서 중국어 1,000개와 영어 1,000개 텍스트를 APS, DSD, RP 조건으로 평가해 시스템당 6,000개 발화를 생성했고, Gemini 3.1 Pro가 이진 스타일 일관성을 판정했다. StepAudio 3 Gen은 중국어 평균 85.2%, 영어 평균 77.7%로 최고를 기록했으며, Qwen3-TTS-12Hz-1.7B-VoiceDesign, MOSS-VoiceGenerator, Ming-omni-tts-0.5B, VoiceSculptor를 비교 대상으로 삼았다. 인간 선호도에서는 Elo 1668.5로 1위, 490회 비교에서 종합 승률 75.5%, 상대별 65.3%에서 85.7%를 기록했다.

확장 기능으로는 텍스트-보컬과 음성-보컬, 60초를 넘는 장편 기악 음악, 단일 효과음과 다중 음원·앰비언스·상호작용을 포함한 복합 음향 장면, 여러 화자와 배경음을 함께 모델링하는 바이브 스피치가 제시된다. 제어는 ROLE, DIRECTOR, SCRIPT 세 필드의 통합 지시 형식을 쓰며, 발화 구간에 화자 태그와 선택적 (description)을 붙이고 효과음과 음악은 [description] 항목으로 표기해 시간 순서를 명시한다. 개발자 관점에서는 TTS, 음악, 효과음을 하나의 토큰 공간과 LLM으로 처리해 파이프라인을 단순화할 수 있다는 점이 매력적이지만, 한국어 성능과 실제 지연시간, 스트리밍 품질, 라이선스, 학습·추론 비용은 논문에서 검증되지 않았다. 또한 원문에는 명시적 한계 절이 없고, 설계상 한계로 프레임 내 결합 분해가 역방향, 즉 예측기 출력이 백본으로 되먹임되지 않는 방향을 포기한다는 점, 그래서 두 절반을 예측기가 수렴한 뒤에야 공동 학습한다는 점, 3단계의 그래디언트 분리가 초기 음향 학습을 제한할 수 있다는 점이 드러난다. RVQ Adaptor와 텍스트 보존 표의 구체 수치가 본문에 없고, TTS 평가가 중국어 주관 평가에 치우쳐 있으며, 보이스 디자인 평가도 Gemini 3.1 Pro 판정과 인간 선호에 의존한다는 점은 재현성과 일반화를 확인할 때 주의할 지점이다.