WorldSonus가 월드 모델 영상에 실시간 스테레오 사운드를 입힌다
WorldSonus: Bringing Sound to Worlds
무엇인가
월드 모델은 사용자 입력에 반응해 시각 환경을 실시간으로 만들어내지만, 그 환경은 대부분 무음이다. WorldSonus를 제안한 저자들은 인터랙티브 월드 모델에 소리를 입히려면 세 가지가 동시에 필요하다고 본다. 첫째, 진화하는 비디오 스트림을 따라잡을 실시간 생성, 둘째, 세션이 진행되는 중간에 바뀌는 텍스트 지시에 반응하는 제어, 셋째, 카메라 시점 변화에 맞춰 좌우가 정렬되는 스테레오다. 기존 연구는 크게 두 갈래인데, 오디오 합성을 시각 백본에 직접 결합한 공동 생성 모델은 시각 전용 월드 모델에 모듈로 끼워 넣을 수 없고 긴 자기회귀 롤아웃에서 오차가 누적된다. 전용 V2A 생성기 쪽도 V-AURA는 양방향 시각 윈도우에 모노 출력이고, SoundReactor는 실시간 스테레오를 내지만 스트림 중간 텍스트 제어가 없으며, SwanSphere는 파노라마 영상과 1차 앰비소닉(FOA) 사운드필드를 대상으로 해 일반 원근 스트림에는 맞지 않는다.
어떻게 동작하나
WorldSonus는 시각 스트림을 외부에서 받아 오디오만 담당하는 모듈형 V2A 프레임워크다. 스트리밍 청크 t마다 시각 프레임 v_t와 활성 프롬프트 p_t를 받아 오디오 잠재 청크 a_t를 예측하며, 전체 분포를 과거 상태 M_{t-1}에 조건화된 인과적 곱으로 분해한다(식 1). 이때 M_{t-1}은 최대 길이 W로 제한된 슬라이딩 윈도 Key-Value 캐시, 즉 Ring-KV로 유지되어 스트림이 길어져도 메모리와 연산이 늘지 않는다. 오디오는 48kHz 스테레오를 30Hz 잠재로 인코딩하는 동결된 인과 스테레오 VAE(SoundReactor에서 가져옴)의 연속 잠재 공간에서 생성되며, 100ms 생성 청크는 3개의 잠재 프레임에 대응하고 이는 30FPS 시각 프레임 3장과 시간 정렬된다. 각 청크에서 디코더 전용 트랜스포머가 이전 오디오 청크와 현재 비디오 청크에서 뽑은 두 개의 청크 집계 토큰을 처리해 세션 상태를 유지하고, 그 자기회귀 은닉 상태 h_t가 소형 flow head를 조건화해 rectified flow 목적함수로 청크의 3개 잠재 프레임을 디노이징한다. flow head는 현재 청크 내부만 양방향으로 보고 미래 블록은 보지 않는다.
무엇과 다른가
핵심 설계 중 하나는 시각 조건을 두 시간 스케일로 분리한 것이다. 동결된 DINOv3 인코더가 각 프레임을 패치 그리드 G_n으로 매핑하고, 시간 차분 ΔG_n = G_n − G_{n-1}을 이어 붙여 움직임 단서를 담는다. 학습된 쿼리가 프레임별 그리드를 하나의 토큰으로 집계해 청크당 3개의 프레임 토큰을 만든 뒤, 다시 요약 쿼리가 이를 하나의 청크 수준 시각 토큰으로 압축해 AR 백본에 넣는다. 반면 정제된 3개의 프레임 토큰은 AR 백본을 우회해 flow head에 직접 들어간다. 저자들은 이 이중 경로가 개별 프레임의 시간 해상도를 보존하는 데 필수적이라고 말한다. 소거 실험에서 이 직접 경로를 제거하면 FAD가 2.42에서 15.82로 급등해, 프레임 수준 시각 입력과 자기회귀 문맥의 결합이 명료하고 동기화된 오디오 생성에 결정적임을 보인다.
어떻게 쓰나
인터랙티브 제어는 T5Gemma 2 텍스트 인코더로 지시를 압축 토큰 집합으로 투영해 AR 백본에 cross-attention으로 넣고, 이 캐시를 스트리밍 단계에 걸쳐 재사용하는 방식으로 구현된다. 스트림 도중 지시가 바뀌면 가장 가까운 청크 경계에서 cross-attention 캐시만 제자리 교체하고 Ring-KV 캐시와 기존 시각·오디오 상태는 그대로 둔다. 이를 학습하기 위해 중간 지시 전환과 드롭을 포함한 시간 가변 프롬프트 스케줄을 쓴다. 인과적 스트리밍에서는 미래 프레임이 없어 정밀한 시간 동기화가 어렵기 때문에 저자들은 두 가지 장치를 둔다. 청크 수준 요약은 AR 백본의 의미 연속성을 잡고, 프레임 정렬 토큰은 flow head에 세밀한 단서를 준다. 여기에 학습 시에만 쓰이는 ShiftNCE 목적함수를 추가한다. 동결된 동기화 인코더가 만든 정답 임베딩 S_t와, 같은 영상에서 청크 오프셋 δ만큼 시간 이동한 S_{t+δ}를 대조해 생성기의 AR 상태 h_t가 올바른 시간 위치를 예측하도록 만든다(식 3). 정적인 시각 구간에서 생기는 거짓 음성은 교사 모델 기준 시각 유사도가 높은 후보를 걸러내 방지한다. 최종 손실은 L_flow + λ_sync·L_sync이며, ShiftNCE는 추론 시 오버헤드가 전혀 없다. 소거 실험에서 ShiftNCE를 빼면 DeSync가 0.831에서 1.067로 나빠지고, 640ms 창의 동기화 특징을 직접 주입하면 1.043으로 오히려 손해였다.
전제와 한계
학습 데이터는 총 1,465시간으로, 스테레오 비디오-오디오 쌍 999시간과 오디오 단독 466시간이다. VGGSound, AudioSet, Kinetics-700, HD-EPIC에 더해 카메라 움직임과 동적 객체가 뚜렷한 스테레오 영상을 추가로 모았고, Sphere360과 YT-AmbiGen의 파노라마 녹음은 음향 에너지장에서 수평 음원 방향을 추정해 원근 시각 크롭을 샘플링하고 시점 정렬 스테레오 오디오를 렌더링해 쓴다. 오디오 단독 데이터는 AudioCaps와, 영상과는 정렬되지 않지만 음향 이벤트 품질이 높은 약정렬 영상의 오디오 트랙이다. 필터링은 2단계로, 먼저 무음·위상 손상·협대역 스테레오·듀얼 모노를 신호처리로 제거하고, Qwen3-Omni를 검증자로 써서 심한 교차 모달 불일치와 내러티브 음성·배경음악 같은 비-다이제틱 오디오를 걸러낸다. 캡션도 Qwen3-Omni로 만들되 음향 범주, 음향 질감, 시간적 타이밍, 공간적 분위기에 초점을 맞추고 소리와 무관한 시각 디테일은 배제한다.
평가는 VGGSound 클리어 스테레오 5초·10초(각 4,096 클립), 동적 카메라가 있는 인터랙티브 게임플레이·실사 5초·10초(각 4,096)와 30초(1,024), 그리고 Greatest Hits의 물리 충돌 이벤트에서 이뤄졌다. 베이스라인은 양방향 스테레오 모델 AudioX, ThinkSound, PrismAudio와 스트리밍 모노 V-AURA다. WorldSonus는 5초 VGGSound에서 VGGish FAD 1.73, 30초 인터랙티브 영상에서 2.03을 기록했고, 단일 H100에서 100ms 청크당 41.2ms(RTF 0.41)로 실시간 조건을 만족한다. 공간 정합을 보는 BiasSkill(1초 창에서 생성 오디오와 정답이 같은 좌우 채널을 선호하는지)에서 WorldSonus는 VGG 10초 4.42, 인터랙티브 10초 6.03, 30초 15.90으로, AudioX(3.79/3.08/−0.01), ThinkSound(3.22/−1.78/0.63), PrismAudio(1.10/−0.06/4.19)를 모두 앞선다. 다만 Synchformer 특징을 직접 최적화하는 양방향 베이스라인들이 DeSync는 더 낮았고, WorldSonus는 테스트 시 가이던스 없이 Greatest Hits 온셋 벤치마크에서 Acc 0.803, F1 0.785, AP 0.871로 경쟁력 있는 타이밍을 유지했다. 30초 롤아웃 꼬리 구간은 콜드 스타트 직접 생성과 비교해 FAD 2.51 대 2.63, DeSync 0.827 대 0.880으로 거의 차이가 없어, 5초 Ring-KV 캐시 아래에서 주기적 리셋 없이 붕괴 없는 스트리밍이 유지된다. 텍스트 제어는 10초 클립을 5초씩 나눠 각 구간이 자기 캡션과 더 잘 맞는 비율(dual relative match rate)로 재었을 때 VGGSound 25.68%, 인터랙티브 10초 23.44%로 모든 베이스라인을 앞섰고, 시각 특징과 시드를 고정한 반사실 개입 실험에서도 개입 이득 +0.0509, +0.0525(95% 부트스트랩 신뢰구간이 0을 배제)를 보였다. 40개 클립에 대한 블라인드 A/B 청취 실험(평가자 20명, 400회 쌍대 평가)에서 전체 선호도는 AudioX 대비 58.8%, ThinkSound 대비 80.0%, PrismAudio 대비 65.0%였다.
실무적으로 WorldSonus가 겨냥하는 자리는 시각 월드 모델 위에 얹는 별도 오디오 모듈이다. 상류 모델의 액션 공간이나 내부 구조에 접근할 필요 없이 이미 렌더링된 프레임만 받고, 사용자나 에이전트가 오디오 프롬프트를 독립적으로 갱신할 수 있다는 점이 통합 관점에서 중요하다. 청크 크기 선택도 참고할 만한데, 33ms로 줄이면 FAD가 3.79로 나빠지고 200ms로 늘리면 지연만 커지며 지표 개선이 일관되지 않아 100ms가 실용적 균형으로 선택됐다. 도입 전에는 5초 Ring-KV라는 유한 문맥이 자신의 시나리오에 충분한지, 그리고 인과 VAE의 복원 품질 한계가 최종 음질 상한을 어디까지 누르는지 확인해야 한다.
저자들이 밝힌 한계는 두 가지다. 첫째, WorldSonus는 SoundReactor에서 가져온 동결 인과 스테레오 VAE의 연속 잠재 공간에서 오디오를 생성하는데, SoundReactor는 인과 VAE 디코더의 복원 품질이 비인과 버전보다 낮다고 보고한다. 더 표현력 있는 대규모 인과 오디오 코덱 개발이 이 격차를 좁히는 향후 과제다. 둘째, 고품질 공간 오디오 데이터는 대규모 모노 코퍼스에 비해 여전히 희소하고, 공개 스테레오 영상 상당수는 시각 객체 움직임을 정확히 반영하지 못하는 인공적이거나 잡음 섞인 채널 분리를 담고 있다. 2단계 필터링과 파노라마 사운드필드 디코딩으로 신뢰할 만한 공간 지도를 뽑아내지만, 진짜 스테레오 데이터의 규모를 키우는 것이 남은 목표다.