StepAudio 3 Realtime은 말하며 추론하는 실시간 음성 모델이다.

StepAudio 3 Realtime Technical Report

HF Daily2609.14005

Bin Lin, Bo Zhao, Boyang Zhang2026-09-12조회 4

무엇인가

실시간 음성 대화가 어려운 이유는 여러 요구가 동시에 충돌하기 때문이다. 사용자가 말을 끝내지 않은 침묵과 실제 발화 종료를 구분해야 하고, 모델이 말하는 도중 들어오는 짧은 맞장구와 발화권을 넘겨달라는 요구를 구분해야 한다. 복잡한 요청에는 깊은 추론이 필요하지만 응답은 즉각적이어야 하며, 도구 호출이 붙으면 외부 작업이 그것을 촉발한 대화보다 오래 살아남는다. StepFun-Audio 팀의 StepAudio 3 Realtime 기술 보고서는 이 문제들을 듣기, 대화, 사고, 행동의 연속 루프 하나로 묶어 해결하려는 시도다.

어떻게 동작하나

핵심 구조는 네 가지 요소의 동시 운영이다. Deep Perception은 사용자가 무엇을 말했는지뿐 아니라 어떻게 말했는지(운율, 비언어적 단서, 음향 이벤트, 시간 구조)를 포착한다. Seamless Duplex는 사용자 오디오와 모델 자신의 오디오 두 스트림을 동기화해 발화권을 관리하는데, 오디오를 320ms 블록으로 나누고 각 블록 뒤에 상태 토큰 또는 텍스트 토큰을 끼워 넣는 시간 인터리빙 표현을 쓴다. 이 표현 위에서 계속 듣기, 응답 시작, 계속 말하기, 발화권 양보를 결정하며, 모델은 자신이 현재 말하고 있는 내용까지 참조해 겹쳐 들어오는 사용자 발화의 역할을 해석한다. Think-While-Speaking은 같은 오디오 모델에 대한 두 개의 동시 호출로 구성된다. Formulation Brain이 비공개 추론 트레이스를 생성하고, Articulation Brain이 지금까지 나온 추론과 이미 말한 응답을 조건으로 짧은 응답 세그먼트를 만든다. 재생 진행에 맞춰 세그먼트를 내보내는 playback-aware 스케줄링을 쓰고, 기본값인 Speak-First는 추론 접두부를 기다리지 않고 말을 시작하며 Think-First는 짧은 추론 접두부를 기다린다. Adaptive Thinking이 명시적 추론을 쓸 턴인지 정하고, MTP(멀티 토큰 예측)가 비공개 사고 스트림의 디코딩 비용을 줄인다. 여기에 Voice Agent가 직접 응답, 경량 도구 호출(날씨, 웹 검색), 비동기 백엔드 실행을 요청 특성에 따라 라우팅하고, 실행 중에도 대화가 이어지도록 한다.

무엇과 다른가

모델은 전문가 혼합(MoE) 구조이며, 오디오 프런트엔드는 Qwen3-Omni의 Audio Transformer(AuT) 인코더를 쓰고 어댑터가 인코더 출력을 언어모델 표현 공간으로 사상한다. 전이중 입력 경로는 사용자 오디오와 모델 오디오를 함께 받고, 텍스트 토큰은 별도 경로로 디코더에 들어가 음향 정보와 텍스트 맥락에 동시에 조건화한다. 생성기는 스트리밍 모델 오디오를 만들고 이것이 다시 모델 오디오 스트림으로 되돌아간다. 사전학습은 모달리티 정렬, 멀티모달 혼합 학습, 쿨다운의 3단계로 진행되며 고정 시퀀스 길이 32K에서 1.2T 토큰을 처리한다. 중간학습에서 문맥 길이를 128K로 늘려 긴 대화 이력과 중간 도구 결과를 수용하고, 음성 이해 및 에이전트 상호작용 데이터 비중을 크게 높인다. 데이터 큐레이션은 음향 이벤트 검출과 VAD로 원본 오디오를 거른 뒤 병합·재분할하고, 품질·합성음성 가능성·화자 수 같은 메타데이터를 붙이며, 여러 인식 시스템의 전사를 교차 검증해 품질 인지 샘플링을 가능하게 한다. 전이중 학습에는 1만 시간 이상의 합성 전이중 상호작용 데이터가 스트리밍 ASR, VAD, 발화 완결성 예측 감독과 함께 쓰인다.

어떻게 쓰나

음성 인식 특화 모델인 StepAudio 3 ASR Max는 Realtime 모델과 사전학습·중간학습을 공유하고 지도 미세조정에서만 갈라진다. 오디오 인코더는 동결하고 어댑터와 언어 디코더를 갱신하며, SpecAugment 원리에 따른 시간-주파수 마스킹을 적용한다. 장형 음성은 여러 인식기의 가설을 ROVER로 정렬·융합하고 일치도 기반 필터링으로 신뢰 구간을 골라 재구성한 뒤 LLM이 문장부호를 복원한다. 동음이의어가 많은 희귀 고유명사·기술 용어는 LLM이 지식 분류체계를 확장해 후보 용어를 열거하고 자연스러운 문장에 넣어 음성으로 합성한 뒤, 발음이 목표 텍스트와 일치하는 경우만 남기는 방식으로 보강한다. 결과적으로 LibriSpeech test-clean/test-other와 AISHELL-1에서 모두 최고 성능을 내고, WenetSpeech 두 서브셋에서 Doubao 2.0 ASR과 Seed 2.0 Lite를 앞서며 HY3.0 ASR Preview에는 근소하게 뒤진다. ContextASR-Bench에서는 영어·중국어, Speech·Dialogue 네 서브셋 모두 1위로, 영어 매크로 평균 오류율 5.67%, 중국어 1.23%를 기록해 HY3.0 ASR Preview의 6.60%, 1.69%를 앞선다.

전제와 한계

오디오 이해 평가는 8개 벤치마크 중 4개에서 1위다. MMSU에서 90.6 대 83.6, MMAR에서 86.5 대 81.7로 각각 7.0점, 4.8점 차이를 냈고 Step-Caption과 MTalk-Bench에서도 앞선다. MMAU와 WildSpeech에서는 Gemini 3.1 Pro에 근접하고, 8개 매크로 평균은 81.3으로 Gemini 3.1 Pro와 0.5점 차이다. 반면 AudioMultiChallenge에서는 Gemini 3.1 Pro에 17.7점 뒤진다. 데이터 품질 실험도 눈에 띈다. SFT 데이터만 바꾼 절제 실험에서 무작위로 뽑은 약 200만 개 예시와 품질 관리를 통과한 약 10만 개 예시를 비교했는데, 후자가 MMSU를 78.78에서 89.70으로, MMAR을 74.70에서 84.50으로, WildSpeech를 74.20에서 77.11로, MTalk-Bench의 ambient·paralinguistic·semantic 서브셋 매크로를 88.83에서 90.84로 끌어올렸다. 약 20분의 1 규모로 더 좋은 결과를 낸 셈이다.

전이중 상호작용에서는 Artificial Analysis Full-Duplex Bench에서 Overall 98.9로 1위를 차지해, 가장 강한 베이스라인인 Qwen Audio 3.0 Realtime Plus의 98.4를 넘는다. 항목별로는 turn taking 100.0, 사용자 끼어들기 처리 99.0, 침묵 처리 98.9, 맞장구 처리 98.0이다. 대화 지능 쪽은 StepAudioChat에서 추론 모드 매크로 평균 73.0으로 Doubao 2.0 Lite의 70.5와 DeepSeek-V4-Flash의 71.4를 앞서고 Kimi K3의 77.1에는 못 미친다. 추론, 기억, 지식, 대화 화용, 페르소나 일관성에서 2위다. Think-While-Speaking을 적용한 실시간 시스템은 StepAudioChat 매크로 평균 70.41로 Doubao 2.0 Lite 70.5, DeepSeek-V4-Flash 71.4와 비슷한 수준을 유지하는데, 논문은 이를 두고 지연만 낮춘 표면적 응답이 아니라 전용 추론 모델에 준하는 대화·추론 성능을 말하면서 확보한 것이라고 주장한다. 모델 병합 실험에서는 가장 강한 대화 교사 모델 74.2에는 못 미치지만 나머지 교사들보다는 높아, 병합이 균형 잡힌 절충을 준다는 점을 보인다.

도구 사용은 Artificial Analysis의 τ-Voice 구현으로 평가한다. 항공사·소매·통신 고객 서비스 과제에서 최종 데이터베이스 상태가 목표와 일치해야 성공으로 인정되며, StepAudio 3 Realtime은 매크로 과제 성공률 56.0%를 기록해 Grok의 56.5%에 근접하고 Qwen 54.6%, GPT 45.7%를 앞선다. 통신 도메인에서는 70.2%로 평가 모델 중 최고이며 Grok을 6.5%포인트 앞선다. 항공사는 60.0%로 최고 보고치 62.0%와 2.0%포인트 차이고, 소매는 37.7%로 Grok의 49.7%에 크게 뒤진다. 일반 텍스트 능력에서는 HMMT February 2026에서 86.8로 1위지만 GPQA Diamond와 MultiChallenge는 Gemini 3 Flash보다 낮다.

개발자 관점에서 이 보고서의 실용적 의미는 세 가지다. 첫째, 실시간 음성 에이전트의 발화권 관리를 320ms 블록과 상태 토큰이라는 구체적인 시간 단위로 구현하고, 맞장구와 끼어들기를 구분하는 판단을 대화 이력과 두 오디오 스트림에 근거해 수행한다는 설계는 직접 참고할 만하다. 둘째, Think-While-Speaking처럼 추론과 발화를 병렬로 돌리고 재생 진행에 맞춰 세그먼트를 내보내는 방식은 지연 예산이 빡빡한 음성 서비스에서 추론 품질을 포기하지 않는 한 가지 패턴을 제시한다. 셋째, SFT 데이터를 20분의 1로 줄이고도 지표가 올랐다는 절제 실험은 음성·오디오 파인튜닝에서 데이터 양보다 품질 관리 파이프라인이 더 중요할 수 있음을 시사한다. 다만 도입 전에 확인할 점도 분명하다. 저자들이 밝힌 대로 다중 턴 제약 조건 유지와 소매 도메인 도구 사용은 여전히 약점이고, AudioMultiChallenge에서 17.7점 격차가 나는 만큼 자연스러운 다중 턴 오디오에서 제약을 유지·수정하는 능력은 별도로 검증해야 한다. 또한 Adaptive Thinking은 명시적 추론의 빈도를 줄이지만 답변 품질에 미치는 영향이 일관되지 않다고 논문 스스로 인정하며, ASR 수치는 ASR 특화 모델의 것이지 실시간 모델의 전사 동작이 아니라는 점도 전제로 달려 있다.