SoL-Refiner가 4K 영상 정제를 단일 디노이징 스텝으로 압축한다

SoL-Refiner: Speed-of-Light One-Step Refinement for High-Resolution Video

HF Daily2609.37969

Haozhe Liu, Tian Ye, Shuchen Xue2026-09-29조회 3

무엇인가

고해상도 영상 생성은 시공간 토큰 수가 늘어날수록 비용이 급격히 커진다. 모델이 커지면 디노이징 스텝마다 드는 비용이 올라가고, 해상도가 높아지면 토큰 시퀀스가 길어져 모든 스텝의 비용이 다시 증가한다. 저해상도로 먼저 생성한 뒤 리파이너를 붙이는 2단계 설계가 실용적 대안이지만, 기존 리파이너는 목표 해상도에서 여러 번의 디노이징을 요구해 두 번째 샘플링 병목을 만든다. 게다가 대부분 특정 베이스 생성기 전용으로 개발돼 다른 생성기 출력으로 옮겼을 때의 성능은 거의 평가되지 않았다. 엔비디아 연구진이 제안한 SoL-Refiner는 이 두 문제를 동시에 겨냥한다.

어떻게 동작하나

학습은 세 단계로 진행된다. 1단계 continual training은 짝지어진 저품질·고품질 영상으로 정제 매핑 자체를 익힌다. 주된 학습 데이터는 내부 실영상 데이터셋으로, 원본을 고품질 타깃으로 두고 공간 다운샘플 후 업샘플해 저품질 조건 영상을 만든다. 소량의 합성 쌍은 초기 워밍업에만 쓴다. 여기서 쓰는 truncated-σ flow matching이 핵심인데, 저품질 잠재 z_ℓ에 σ_start=0.91만큼 노이즈를 섞어 z_1을 만들고, λ_t = σ_t/σ_start로 z_t = (1-λ_t)z_h + λ_t z_1 경로를 정의한다. 목표 속도는 v* = (z_1 - z_h)/σ_start다. 가장 노이즈가 심한 끝점에서도 z_ℓ의 정보가 남아 있기 때문에, 모델은 순수 노이즈에서 영상을 복원하는 대신 정제 방향으로 벡터장을 학습하게 된다. 조건에는 텍스트와 참조 이미지 특징이 들어가며, 참조 이미지 토큰은 손실에서 제외해 재구성 대상이 아니라 가이드로만 쓰인다.

무엇과 다른가

2단계는 Reward Feedback Learning으로 지각 품질을 끌어올린다. 1단계의 flow matching 목적함수는 인간 선호나 지각 품질을 직접 최적화하지 않기 때문이다. 노이즈가 많은 초반 상태의 clean latent 예측은 보상 모델에 넣기엔 신뢰도가 낮아, 보상 감독을 후반 업데이트 구간 T_late = {k,...,N}으로 제한하고 τ를 균일 샘플링한다. τ 이전 업데이트는 그래디언트 없이 롤아웃하고, 선택된 상태에서 오일러 한 스텝으로 clean latent를 추정한 뒤 디코딩된 프레임에 보상을 매긴다. 영상을 3등분해 각 구간에서 프레임 하나씩 뽑고, HPSv3++로 프롬프트 조건 인간 선호를, DeQA로 열화 인지 품질을 평가한다. 두 점수는 각각 10과 4.5에서 상한을 잘라 이상치가 보상을 지배하지 못하게 하고, 1/3과 2/3의 가중으로 합친다. 최종 설정은 유효 업데이트 N=12, τ는 {6,...,12}에서 샘플링하며 평가는 23 업데이트 전체 스케줄을 쓴다.

어떻게 쓰나

3단계는 증류다. 먼저 3스텝 학생을 DMD로 학습시키는데, 학습 가능한 학생 생성기, 동결된 real-score 교사, 학습 가능한 fake-score 모델 세 역할을 두고 생성기 노이즈 레벨을 {0.91, 0.73, 0.42}에서 샘플링한다. fake-score 모델은 생성기 업데이트 5회마다 한 번 갱신되고, 생성기 갱신 후에는 IDA로 fake-score 파라미터를 생성기 쪽으로 β=0.97만큼 이동시킨다. 이 3스텝 체크포인트에서 출발한 1스텝 증류는 σ_start=0.73으로 고정해 추론 스케줄 [0.73, 0]과 맞춘다. DMD 손실에 projected DiT 판별기를 더해 고품질 잠재로부터 직접 감독을 받는데, 동결된 real-score DiT를 특징 추출기로 재사용하고 블록 21, 34, 47의 토큰 특징을 노이즈·텍스트 조건 쿼리 헤드로 풀링해 진짜/가짜 로짓 하나로 매핑한다. 판별기가 실제/가짜 브리지 상태를 너무 빨리 분리해 불안정한 신호를 주는 것을 막기 위해 aR1 정규화를 쓴다. 추론 단계에서는 Sol-Engine의 커널 퓨전과 Sol-Attn 기반 희소 어텐션으로 디노이징 연산을 줄이고, tiny autoencoder(TAE)로 VAE를 대체해 인코딩·디코딩 지연을 낮춘다.

전제와 한계

평가는 다른 생성기들의 출력으로 구성한 Refiner-Bench 150개 영상에서 이뤄졌다. 모든 입력을 1024×576으로 맞추고, LingBot Stage-2, LTX-2.3, LTX-2.0, SEEDVR2와 비교했다. 출력 해상도는 LingBot이 1920×1088, 나머지가 2048×1152다. 1스텝만 쓴 SoL-Refiner가 VBench의 미학적 품질(AQ), 이미징 품질(IQ), 평균과 UniPercept 평균에서 평가된 모든 외부 리파이너를 앞섰다. VBench 평균 0.81048, UniPercept 평균 60.4150이며, 23스텝 변형은 이보다 더 높다. 3840×2176에서는 3스텝 LTX-2.3 Refiner 대비 VBench 평균 3.86%, UniPercept 평균 22.79% 개선됐다.

지연시간 개선 폭도 구체적으로 보고된다. 2K 지연 설정에서 TAE와 Sol-Engine을 포함한 1스텝 모델은 3스텝 LTX-2.3 Refiner 대비 정제 지연시간을 8.91배 줄였고, 절대값은 57.461초에서 6.447초로 떨어졌다. 분해하면 1스텝 증류가 1.82배, TAE가 2.37배, Sol-Engine이 2.06배를 각각 기여했고, 멀티스텝 리파이너에 Sol-Engine만 붙였을 때는 해상도·프레임 수 조합에 따라 2.38~3.26배가 나왔다. 4스텝 MiniMax H3 베이스와 결합한 2단계 파이프라인은 GB200 한 장에서 5초·1344×768·24fps 영상을 152.3초에서 5.64초로 줄여 27.03배 빨라졌다(H3 생성 4.06초 + 리파이너 1.56초). WAN-5B, WAN-1.3B, Cosmos-Nano에 붙였을 때도 지연이 각각 54.7%, 71.1%, 64.4% 감소하면서 평균 VBench와 UniPercept는 직접 고해상도 생성보다 좋아졌다. DGX Spark(GB10)에서는 384p H3 생성 후 768p로 정제하는 SoL-H3 파이프라인이 56.17초에서 39.67초로 29.4% 줄었고, 768p 직접 4스텝 H3 대비 9.43배다.

학습 레시피 소거 실험에서는 RL post-training이 VBench와 UniPercept 평균을 가장 크게 올렸고, 증류 후에도 continual training만 쓴 베이스라인보다 두 지표 모두 높게 유지됐다. 보상 정규화나 다중 보상 모델 중 하나를 빼면 VBench 평균이 떨어졌다. 증류 방식은 RL 후 DMD를 순차 적용하는 쪽이 RL과 DMD를 함께 최적화하는 DMD-R보다 VBench 평균이 높아 최종 설정으로 채택됐다.

실무 관점에서 이 논문이 주는 신호는 명확하다. 이미 저해상도 생성 파이프라인을 돌리고 있다면, 목표 해상도에서 한 스텝만 쓰는 리파이너를 붙여 전체 지연을 크게 줄일 수 있다는 근거가 수치로 제시된다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, SoL-Refiner는 '지원되는' 베이스 생성기를 전제로 하며 LTX-2.3 체크포인트에서 초기화됐다. 논문은 베이스 모델을 수정하거나 재학습하지 않고 다른 생성기 출력을 정제할 수 있다고 하지만, 전이 평가는 WAN-5B, WAN-1.3B, Cosmos-Nano, MiniMax H3 등 논문이 다룬 생성기에 한정된다. 둘째, 1단계 학습의 주된 짝 데이터가 내부 실영상 데이터셋이라 동일 재현에는 자체 페어 데이터 구성이 필요하다. 셋째, 논문은 별도의 한계 절을 두지 않았고 Refiner-Bench도 150개 영상 규모다. 4K 개선 수치(3.86%, 22.79%)가 3스텝 LTX-2.3 Refiner 한 개 베이스라인과의 비교라는 점도 함께 봐야 한다.