LoGo가 3D 복셀 단위 보상으로 장기 영상 생성의 국소 불일치를 잡는다

LoGo: Local-Global Rewards for Consistent Long-Horizon Video Generation

arXiv2610.03636v1

Ziqi Ma2026-10-02조회 4

무엇인가

카메라 제어 영상 생성 모델이 생성 길이를 늘리고 복잡한 카메라 궤적을 다루면서 핵심 실패 모드로 떠오른 것이 3D 불일치다. 카메라가 움직이면 물체의 항상성이 깨지고 장면 구조가 밀린다. 기존 포스트트레이닝 기법은 생성 결과 전체에 스칼라 보상 하나를 부여하는데, 저자들은 이것이 장기 지평에서는 부적합하다고 주장한다. 3D 불일치 실패는 대개 국소적이어서 전역 보상에 묻힌다. 논문이 든 예에서 롤아웃의 문 불일치는 국소적 오류인데도 나머지 기하가 멀쩡하다는 이유로 클립 전체가 높은 점수를 받아 오류가 벌점화되지 않는다. 기존 3D 일관성 벤치마크도 80프레임, '앞으로 밀기' 같은 단순 카메라 명령에 머물러 있다.

어떻게 동작하나

LoGo의 핵심은 3D 공간에서 직접 credit assignment를 하는 것이다. 먼저 키프레임을 VGGT-Ω에 통과시켜 장면 포인트 클라우드를 만들고, 예측 깊이로 각 픽셀을 공유 좌표계로 역투영한다. 이 공유 3D 공간을 복셀 격자로 나눈 뒤(복셀 크기는 장면 깊이 90퍼센타일의 0.1배), 복셀마다 국소 오류를 계산한다. 복셀 오류는 그 복셀에 역투영된 모든 픽셀의 평균 재투영 오류다. 픽셀의 재투영 오류는 장면 포인트 클라우드를 해당 픽셀로 투영한 RGB와 생성된 RGB의 차이, 그리고 깊이 투영값과 VGGT 예측 깊이의 차이를 가중합(계수 α)한 것이다. 240프레임 영상 기준으로 장면당 복셀 수 중앙값이 약 3,000개, 복셀당 점 수 중앙값이 약 200개다.

무엇과 다른가

국소 보상만 쓰면 화질이 무너진다. 저자들은 이를 리워드 해킹으로 설명한다. 흐릿하고 부드러운 경계는 깊이 오류를 낮추고, 채도가 낮아 회색에 가까운 색은 RGB 오류를 낮추기 때문에 국소 보상이 일관성을 얻는 대신 선명도와 색감을 희생한다는 것이다. 반면 모든 픽셀과 프레임에 걸친 평균 재투영 오류로 정의한 전역 보상은 이런 열화에 더 강건하다. 그래서 두 보상을 정규화한 뒤 가중합한다. LoGo 보상은 1/2에 국소 보상 항(1/4 가중, -1~1 클립)과 전역 보상 항(1/4 가중, -1~1 클립)을 더한 형태다. 여기에 보상 인터리빙을 얹는다. k스텝은 LoGo 보상, m스텝은 미학 보상(HPSv3), n스텝은 카메라 보상(회전 오류와 이동 오류의 동일 가중 합)을 번갈아 쓰는 순환 스케줄이다.

어떻게 쓰나

실험은 새로 공개한 TrajectoryBench와 DL3DV에서 이뤄졌다. TrajectoryBench는 easy/medium/hard 세 난이도와 indoor/outdoor/transition 세 공간 유형에 걸쳐 2,000개 예제를 담는다. easy는 WorldScore에서 80프레임·단일 카메라 모션을 서브샘플링한 것이고, medium은 문을 통과해 새 공간으로 넘어가는 전환 장면과 WorldScore의 단일 모션 명령 세 개를 이어 붙인 것이며, hard는 240프레임에 카메라 모션 7~8개를 넣은 것이다. DL3DV는 기존 연구가 쓰던 100장면 홀드아웃에 원본 카메라 궤적 조건을 추가해 평가한다. 베이스 모델은 세 가지다. Lingbot-world-v2는 KV 캐시로 12프레임씩 생성하는 14B 자기회귀 모델, Lyra-2는 80프레임 청크를 생성하고 카메라 기반 검색을 지원하는 희소 3D 캐시를 쓰는 14B 모델, UniWorld는 80프레임 클립으로 학습된 14B 양방향 모델이다. 세 모델 모두 1,700개 DL3DV 장면으로 수렴까지 학습했고 64대 H100에서 16~36시간이 걸렸다.

전제와 한계

결과 수치는 뚜렷하다. LoGo는 두 벤치마크에서 베이스 모델 대비 3D 일관성을 최대 +2.7dB PSNR, 에피폴라 오류 37% 감소까지 개선했다. 비교 대상인 VideoGPA(전역 스칼라 VGGT 재투영 보상의 DPO)와 World-R1(가우시안 재구성에 대한 VLM 피드백을 쓰는 Flow-GRPO)은 Lingbot2에서 PSNR-GS +0.1dB, PSNR-D +0.2dB 수준의 완만한 개선에 그쳤다. LoGo의 이점은 궤적이 어려워질수록 커진다. easy에서 PSNR-D +1dB였던 격차가 hard에서 +2.5dB로 벌어진다. 영상 길이에 따라서도 마찬가지여서, 80프레임에서 에피폴라 오류 24% 감소였던 것이 400프레임에서는 62% 감소로 확대된다. 절제 실험에서는 복셀 단위 credit assignment가 프레임 단위나 2D 패치 단위보다 강했고, 국소 보상만 쓰면 3D 일관성 지표는 가장 높지만 카메라·미학이 희생되며, 전역 보상과 섞으면 모든 지표에서 베이스 모델을 앞선다. 오버헤드는 전체 보상 계산 시간의 2.1%, 스텝당 학습 시간의 0.5%로, 64대 H100에서 스텝당 총 1,920초 중 9초가 LoGo 몫이다.

개발자 입장에서 이 논문은 카메라 제어 장기 영상 생성 파이프라인의 포스트트레이닝 보상 설계에 직접 쓸 수 있는 레시피다. 스칼라 보상 하나로 롤아웃 전체를 평가하는 대신, 3D 복셀 단위로 오류를 국소화해 벌점을 배분한다는 발상이 핵심이며, DiffusionNFT뿐 아니라 Flow-GRPO와 DRaFT에서도 이득이 유지된다고 보고한다. 다만 도입 전에 확인할 점이 있다. 보상 계산이 VGGT-Ω 기반 장면 재구성에 의존하므로 재구성 품질이 보상 품질을 좌우하고, 정적 장면을 전제로 설계됐으며, 400프레임을 넘는 생성은 보상 설계만으로 해결되지 않을 수 있다.

저자들이 밝힌 한계는 두 가지다. 첫째, 400프레임을 넘는 초장기 생성은 여전히 어려우며 더 나은 보상 설계가 아니라 새로운 메모리 설계가 필요할 수 있다. 둘째, LoGo는 정적 장면에 초점을 맞췄고 동적 장면으로 확장하는 것은 향후 과제인데, 이때는 4D 재구성 기법으로 LoGo와 같은 취지의 보상을 계산할 수 있을 것이라고 제안한다.