LEGO는 깊이 추정 없이 3인칭 영상에서 1인칭 영상을 생성한다

LEGO: A Lifting-Free Approach for Exocentric-to-Egocentric Video Generation

HF Daily2610.12442

Suhwan Cho, Yonwoo Choi, Soongjin Kim2026-10-08

무엇인가

이 논문은 3인칭(외부 시점) 카메라로 찍은 영상 한 편과 목표 1인칭(자기중심) 카메라 궤적이 주어졌을 때, 그 궤적을 따라 이동하는 카메라가 담았을 영상을 합성하는 문제를 다룬다. 두 시점은 겹치는 영역이 거의 없어 목표 영상의 상당 부분은 복사가 아니라 새로 만들어야 한다. 1인칭 데이터는 희소하고 3인칭 영상은 넘치는 상황에서 유용하지만, 기존 방법들은 주변 카메라나 정답 1인칭 첫 프레임 같은 특권 입력을 요구하거나 장면을 명시적으로 재구성하는 경로를 택했다. 현재 최고 성능인 EgoX는 단안 깊이 추정으로 프레임을 포인트클라우드로 들어올린 뒤 1인칭 궤적으로 다시 렌더링한 결과를 비디오 확산 모델의 조건으로 넣고, 깊이에서 유도한 어텐션 바이어스로 생성기를 학습시킨다. 문제는 이 매핑이 결정적이라는 점이다. 각 픽셀이 단 하나의 재투영 위치에 배정되므로 텍스처는 선명하게 유지되지만, 깊이 오차가 곧 '엉뚱한 위치에 놓인 내용'으로 번역된다. 게다가 그 오차가 어디서 생겼는지 알려주는 신호가 없다.

어떻게 동작하나

LEGO의 답은 들어올리지 않기(lifting-free)다. 깊이 추정, 포인트클라우드, 재투영을 전부 제거하고, LVSM 스타일 트랜스포머를 1인칭 뷰를 직접 렌더링하도록 파인튜닝해 뷰 합성기 F로 쓴다. 기하 정보는 픽셀별 Plücker 광선 맵으로만 들어가며, 외부 카메라 좌표계에서 표현된 광선의 모멘트가 두 카메라 사이의 실제 베이스라인을 담는다. F는 외부 프레임과 두 광선 맵을 받아 1인칭 프레임을 예측하고, 정답 1인칭 프레임에 대한 L2 손실과 지각 손실로만 학습된다. 깊이 라벨도 대응 라벨도 쓰지 않는다. 공개된 LVSM 체크포인트는 근접한 핀홀 뷰 사이 보간용이라, 어안 헤드셋 카메라로의 외삽을 위해 전체 가중치를 파인튜닝한다. 비용은 4대의 NVIDIA H200에서 10,000 스텝, 약 3.5시간이며 이후 F는 동결된다.

무엇과 다른가

핵심 논지는 '확산 모델의 조건은 선명함보다 정렬이 먼저'라는 것이다. F 내부에서 각 1인칭 쿼리가 외부 위치들에 어텐션한 가중치를 헤드와 마지막 L개 레이어에 걸쳐 평균하면, 목표 위치마다 소스 위치에 대한 확률 분포 p_u(v)가 나온다. 이 확률적 매핑은 후보 소스들을 평균하므로 텍스처가 흐려지지만(분산 오차), 내용은 제자리에 남는다. 반면 명시적 재투영은 선명하지만 위치가 틀어진다(바이어스 오차). 디노이징 학습은 흐려진 입력에서 세부를 복원하는 데 능하지만 어긋난 내용을 고치는 데는 별도 장치가 필요하다는 것이 저자들의 근거다. 이 분포는 공짜로 신뢰도도 준다. 각 위치에서 확률 질량 상위 k개의 합 c(u)를 신뢰도로 정의하고, 임계값 τ 미만이면 VAE가 0 근처로 매핑하는 중립 회색 γ로 채워 조건에서 배제한다. 여기에 학습이 전혀 필요 없는 추론 시점 가이드 ARC를 얹는다. 레이아웃이 결정되는 초기 고노이즈 단계(h·n 스텝) 동안, 생성기의 클린 추정값 중 1인칭 부분을 신뢰도의 제곱 c²로 가중해 렌더 E와 블렌딩하고 그에 맞는 속도를 솔버에 넘긴다. c²를 쓰는 이유는 중간 신뢰도 영역(대개 흐린 곳)의 보정을 줄이면서 고신뢰 영역은 거의 온전히 반영하기 위해서다. 이후 스텝은 제약 없이 두어 렌더가 구조를, 확산 모델이 세부를 채우게 한다.

어떻게 쓰나

실험은 Ego-Exo4D에서 EgoX 프로토콜을 따라 학습·평가했고, 학습 장면이 포함된 seen과 그렇지 않은 unseen 두 스플릿을 쓴다. 지표는 PSNR, SSIM, LPIPS, CLIP-I, FVD와 VBench의 시간적 플리커(TF), 모션 스무드니스(MS), 다이내믹 정도(DD)다. 저자들은 LEGO가 모든 이미지 지표와 FVD에서 EgoX를 앞서며 PSNR과 LPIPS에서 가장 큰 이득을 냈다고 보고한다. 다만 본문에 실린 표의 구체적 수치는 제공된 원문에 제시되지 않아 절대값은 확인할 수 없다. TF와 MS는 모든 방법이 포화에 가깝고 DD는 비슷한 수준이라고 밝힌다. 절제 실험에서는 포인트클라우드 렌더가 빈 조건보다 낫고, 파인튜닝된 합성기 렌더가 그보다 더 낫다. 파인튜닝하지 않은 합성기 렌더는 포인트클라우드 렌더와 비슷한 성능을 내는데, 이는 이득이 아키텍처가 아니라 1인칭 카메라 적응에서 온다는 증거다. 신뢰도 게이팅은 렌더 영역 일부를 버리면서도 두 스플릿 모두 FVD를 낮추고 나머지 지표는 유지하며, 외부 시점 토큰을 되살리면 모든 지표가 추가로 오른다. ARC는 재학습 없이 전 지표를 개선하지만, EgoX의 깊이 기반 어텐션 바이어스(GGA)는 전체 조건 위에서 개선을 주지 못했고, 포인트클라우드 렌더에 구멍 마스크를 이진 신뢰도로 삼아 ARC를 적용하면 가이드가 아예 없는 것보다 나빴다.

전제와 한계

정렬 대 선명함 가설은 unseen 스플릿에서 직접 검증된다. 정렬은 ZNCC와 같은 위치의 DINO 특징 유사도로, 선명함은 정답 대비 라플라시안 분산으로 측정했다. 합성기 렌더는 가장 흐리지만 가장 잘 정렬되어 있고, 포인트클라우드 렌더는 선명하지만 정렬이 나쁘다. 그런데도 합성기 렌더가 더 좋은 조건이 되며, 두 렌더에서 나온 생성 결과의 선명도는 같아진다. 조건의 흐림이 출력에 남지 않는다는 뜻이다. 합성기 렌더는 깊이 추정과 포인트클라우드 렌더링보다 계산도 훨씬 싸다. 신뢰도가 실제로 렌더의 정확도를 가리키는지도 확인했다. 생성 영상의 윈도우를 신뢰도로 정렬하면 신뢰도가 높은 윈도우의 오차가 모든 컷오프에서 전체 평균보다 낮다. 일반화도 보고된다. Ego-Exo4D로만 학습한 가중치를 파인튜닝 없이 EgoHumans와 Nymeria에 적용해도 모든 지표에서 EgoX를 앞서며, 게이트가 유지하는 렌더 비율은 새 데이터셋에서도 약 15%로 unseen Ego-Exo4D와 비슷하다.

개발자 관점에서 이 논문의 실용적 가치는 '조건을 어떻게 만들 것인가'라는 질문에 대한 답이다. 깊이 추정이 불안정한 극단적 시점 변화에서는 선명하지만 어긋난 조건보다 흐리지만 정렬된 조건이 확산 생성기에 더 유리하며, 그 정렬 품질은 어텐션 분포의 집중도로 측정해 게이팅과 추론 가이드에 재사용할 수 있다. 합성기가 동결된 채 렌더와 신뢰도만 내보내므로 더 강한 합성기가 나오면 교체해 끼워 넣을 수 있고, 가이드가 학습이 아니라 샘플링 단계에 있으므로 재학습 없이 적용·해제가 가능하다. 다만 ARC는 자신이 기준으로 삼는 렌더가 정렬되어 있고 신뢰도 맵이 신뢰할 만할 때만 작동한다는 점을 전제로 확인해야 한다.

저자들이 밝힌 전제와 한계도 분명하다. LEGO는 EgoX의 단일 외부 영상 입력 설정과 이미지-투-비디오 확산 백본, 캔버스 구성을 그대로 유지하며 생성기 자체는 수정하지 않는다. 바뀌는 것은 조건 입력과 샘플링 방식뿐이다. 신뢰도 게이팅은 렌더 영역의 일부를 의도적으로 버리고, 합성기 렌더는 구조는 맞지만 텍스처가 평균화되어 흐릿하다는 특성을 안고 간다. 윤리 측면에서는 공개 데이터셋만 사용하고 새 데이터 수집이나 인간 대상 실험은 없지만, 식별 가능한 개인의 1인칭 영상을 생성하는 것은 프라이버시와 사칭 위험이 있어 모델을 연구용 약관으로만 공개하고 식별 가능한 개인의 생성 영상은 배포하지 않겠다고 명시한다.