Kandinsky 6.0 Video가 영상과 44kHz 오디오를 한 번에 생성한다
Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation
무엇인가
텍스트에서 영상과 오디오를 동시에 만들어내는 일은 한쪽 모달리티만 생성하는 것보다 훨씬 어렵다. 의미, 시간축, 감정이 두 모달리티에 걸쳐 일관돼야 하기 때문이다. Veo 3.1, Sora 2, Wan 2.6 같은 상용 시스템은 자연스러운 립싱크와 배경음, 다국어 음성을 만들어내지만 소스 코드가 없어 재현과 후속 연구가 막혀 있다. ALIVE, SyncFlow, JavisDiT, LTX-2 계열 같은 공개 연구도 나왔지만 클립 길이, 해상도, 동기화 정확도에서 여전히 상용 모델에 뒤진다. Kandinsky 6.0 Video는 이 격차를 줄이려는 시도로, 3B 파라미터의 Lite와 29B의 Pro 두 모델을 함께 내놓는다.
어떻게 동작하나
핵심 구조는 비대칭 이중 스트림 CrossDiT다. 비디오 스트림은 Kandinsky 5.0에서 물려받은 사전학습 백본이고, 오디오 스트림은 새로 학습한 백본이며, 두 스트림은 블록 단위 양방향 크로스 어텐션으로 연결된다. 두 스트림은 트랜스포머 블록 수는 같지만 hidden 차원과 FFN 차원이 달라 파라미터 규모가 갈린다. Lite는 비디오 2B, 오디오 0.6B, 크로스 어텐션 0.4B이고 Pro는 비디오 19B, 오디오 5B, 크로스 어텐션 5B다. 비디오는 Hunyuan VAE로, 오디오는 44kHz를 지원하는 MMAudio 오토인코더로 인코딩·디코딩하며, 텍스트는 Qwen2.5-VL-7B-Instruct와 CLIP ViT-L/14로 임베딩한다. 위치 정보는 RoPE로 넣는데 비디오 토큰은 프레임 번호를 24fps 기준으로 정규화한 값으로, 오디오 토큰은 시간 위치로 인덱싱해 두 모달리티의 시간축을 맞춘다.
무엇과 다른가
학습은 지속 사전학습 전략을 따른다. 먼저 오디오 스트림을 대규모 오디오 코퍼스로 처음부터 학습시키고, 그다음 새로 초기화한 크로스 어텐션 레이어로 사전학습된 비디오 스트림과 연결한 뒤, 짝지어진 오디오-비디오 데이터로 두 스트림을 공동 학습한다. 이때 단일 모달리티 품질을 유지하는 것이 조건이다. 데이터 규모도 함께 공개됐는데, T2I 5천만 장(Kandinsky 5.0 컬렉션의 부분집합), T2V 2천만 장면, T2A 4천만 트랙(5~20초), T2AV 700만 세그먼트, I2AV 11만 6천 쌍이다. T2AV 데이터는 무음·손상 트랙 제거, VABench 기준의 립싱크 정렬 점수(LSA 0~5에서 3 이상)와 Desync(0~1에서 0.1 미만) 필터를 통과한 것만 남겼고, 얼굴이 없는 약 25%는 립싱크가 필요 없어 그대로 유지했다. 이후 단계는 도메인별 지도 미세조정을 모델 수프로 합치고, OmniNFT를 변형한 강화학습 후학습을 거친 뒤, π-Flow와 적대적 정제로 이어지는 2단계 증류로 함수 평가 10회까지 줄인다.
어떻게 쓰나
Full-HD 출력은 별도 초해상도 모델이 담당한다. 기본 생성기와 달리 K-VAE(64 잠재 채널, 공간 16배·시간 4배 압축)의 잠재 공간에서 동작하며, 결정론적으로 잠재를 2배 또는 4배 업샘플링하는 Latent Upscaler와 열화를 제거하고 디테일을 복원하는 텍스트 없는 SR-DiT로 구성된다. SR-DiT는 32개 블록, hidden 1792, 28개 어텐션 헤드, FFN 7168로 약 1.413B 파라미터이며 프롬프트가 필요 없다. 추론 시에는 가로 512×768, 세로 768×512, 정사각 512×512 픽셀 타일 단위로 처리하고, Full-HD 경로는 픽셀 공간에서 1.125배 바이리니어 선업스케일과 2배 경로를 결합한 2.25배 경로를 쓴다.
전제와 한계
평가에서 저자들이 내세우는 수치는 명확하다. VABench에서 Kandinsky 6.0 Video Pro는 평가 대상(Kandinsky 6.0 Video Lite, LTX 2.5) 가운데 음성 품질, 오디오 미학, 텍스트-비디오 및 오디오-비디오 정렬, 립싱크, 비동기화, 시각적 사실성 항목에서 최고 점수를 냈다. 사람이 나란히 비교하는 평가에서는 전작 Kandinsky 5.0 Video Pro를 뚜렷하게 앞섰고 LTX 2.5보다 시각 품질과 음성 품질에서 선호됐다. 상용 시스템과의 비교는 혼합적이어서 Kling 2.6, Veo 3.1 Fast와는 항목별로 강점이 갈리며 경쟁력이 있고, MiniMax H3와 Seedance 2.0은 시각 항목에서 더 강하지만 음성 품질과 오디오-비디오 동기화에서는 대등하다. 강화학습 후학습은 Pro 모델이 생성한 음성의 단어 오류율(WER)을 47% 줄였다. 증류 모델과 비증류 전체 모델의 비교 실험에서는 증류 모델이 대부분 항목에서 선호되거나 동률이었고 평균 선호도 51% 대 49%로, 0.95와 0.975 수준 모두에서 통계적으로 유의한 차이는 없었다. 블록 오프로딩과 메모리 프리셋을 쓰면 16~32GB 메모리의 소비자용 GPU에서도 두 모델을 돌릴 수 있다고 밝힌다.
개발자 입장에서 이 논문의 실질적 가치는 공개 범위에 있다. 모델 가중치, 소스 코드, diffusers 통합이 모두 MIT 라이선스로 풀린다. 즉 립싱크가 있는 짧은 영상과 효과음을 한 번에 만들어야 하는 프로토타이핑, 콘텐츠 제작 도구, 접근성 있는 스토리텔링 도구 같은 용도에 바로 얹어볼 수 있다. 다만 실제 도입 전에 확인할 것은 세 가지다. 첫째, 기본 생성이 SD 해상도이고 Full-HD는 초해상도 모델을 거쳐야 하므로 파이프라인 지연과 타일 수에 따른 비용을 계산해야 한다. 둘째, 클립 길이가 5초로 고정돼 있어 긴 영상이 필요하면 별도 이어붙이기 전략이 필요하다. 셋째, 44kHz 오디오와 립싱크 품질이 한국어 음성에서도 유지되는지는 별도 검증이 필요하다. 학습 데이터 캡션이 러시아어와 영어 중심으로 만들어졌고 러시아 문화 코드 데이터셋이 따로 쓰였기 때문이다.
저자들이 직접 밝힌 한계도 분명하다. 생성 길이가 최대 5초이고, 기본 생성은 SD 해상도이며 Full-HD는 초해상도로 얻는다. 시각 품질과 전반적 오디오 품질에서는 가장 강한 상용 시스템과 격차가 남아 있다. 향후 과제로 더 긴 클립, 더 높은 네이티브 해상도, 참조 기반 조건화 추가를 꼽는다. 윤리 항목에서는 실제 인물의 동의 없는 묘사, 음성·외모 사칭, 미성년자 성적 콘텐츠, 폭력·혐오 조장, 지식재산권 침해 목적의 사용을 명시적으로 반대하고, 생성물 라벨링과 배포 시 콘텐츠 모더레이션 같은 안전장치를 요구한다. 대규모 데이터로 학습된 다른 모델과 마찬가지로 인구집단·문화·언어 대표성의 불균형과 사실·물리·문화적 부정확성이 출력에 반영될 수 있다는 점도 전제로 깔려 있다.