VideoLLM이 중간층에서 잃는 시간 정보를 추론 시점에 다시 주입한다

Before It Fades: Reinforcing Temporal Representations at Inference Time in VideoLLMs

HF Daily2610.01595

Youngwoo Shin, Yusung Ro, Minseo Kim2026-10-01

무엇인가

Video Large Language Model(VideoLLM)은 프레임을 순서대로 받아 시각 내용이 시간축을 따라 어떻게 변하는지 해석해야 하지만, 시간 추론은 구조를 가리지 않고 반복적으로 무너지는 약점이다. 논문이 드는 대표적 실패 사례는 프레임 순서를 뒤집어도 최종 예측이 그대로 나오는 경우다. 순서를 뒤집으면 시간에 관한 질문의 정답은 뒤집혀야 하는데, 모델은 두 입력에 같은 답을 낸다. 기존 접근은 전용 목적함수로 학습시키거나, 시간축을 왜곡한 입력과의 출력 분포를 대조하는 추론 시점 기법이었다. 저자들은 이 실패가 필연이 아닐 수 있다는 관찰에서 출발한다. 중간층 표현은 뒤집힌 입력에 대해 오히려 더 높은 정답 확률을 부여하는데, 그 뒤 층들이 이를 뒤엎는다는 것이다.

어떻게 동작하나

이를 정량화하기 위해 저자들은 시간 발산 벡터 τ_l을 정의한다. 같은 영상의 정방향과 역방향 쌍을 만들어, 마지막 토큰(인과적 어텐션에서 모든 선행 토큰을 본 유일한 위치)의 은닉 상태 차이 h_l^fwd − h_l^rev를 층별로 측정한 값이다. 역방향 영상은 공간 내용과 텍스트 조건이 동일하므로, 은닉 상태의 차이는 순수하게 시간 순서 기여분만 분리해낸다. 층 깊이에 따라 은닉 상태 크기가 단조 증가하는 효과를 상쇄하려고 정방향 활성값 노름으로 나눈 정규화 발산 τ̂_l = ||τ_l|| / ||h_l^fwd||를 쓴다. Qwen2.5-VL-7B, Qwen3-VL-8B, InternVL2.5-8B 세 모델에서 TempCompass의 이진 시간 질문 50쌍으로 측정한 결과, 세 모델 모두 같은 모양의 곡선을 그린다. 초기층에서는 낮게 유지되다가 중간층부터 급격히 상승해 중후반층에서 정점을 찍고, 이후 출력을 향해 점진적으로 감소해 시작 지점과 비슷하거나 그 이하로 떨어진다. 비전 인코더, LLM 백본, 위치 인코딩, 학습 레시피가 모두 다른 모델에서 같은 프로파일이 나온다는 점을 저자들은 디코더 전용 VideoLLM이 프레임 순서 의존 정보를 처리하는 공통된 계산 규칙성으로 해석한다.

무엇과 다른가

이 정점이 시간 추론에 특이적인지도 검증한다. 같은 영상 쌍을 고정하고 질문만 바꿔서, 프레임 순서 인식이 필요한 시간 질문, 뒤집어도 답이 변하지 않는 공간 질문, 영상과 무관한 질문 세 조건에서 τ̂_l을 측정했다. 비시간 조건에서는 뚜렷한 정점이 크게 약화되고 이후 층에서도 낮게 유지된다. 같은 영상 쌍이 질문에 따라 다른 프로파일을 만든다는 것은, 이 정점이 시각 입력에서 수동적으로 물려받은 차이가 아니라 과제가 요구할 때 마지막 토큰이 선택적으로 시간 정보를 모아 올린 결과라는 뜻이다. 기능적 중요성은 어텐션 녹아웃으로 확인한다. 각 층에서 마지막 토큰이 다른 위치를 보지 못하게 마스킹하고 정답 확률 변화를 재보면, 정점 부근 층을 막을 때 확률 하락이 가장 크다. 즉 이 층들의 시간 정보는 부수적 활성 패턴이 아니라 실제 예측에 쓰인다.

어떻게 쓰나

제안 방법인 Temporal Activation Injection(TAI)은 이 정점을 개입 지점으로 삼는다. 먼저 역방향 영상을 정점 층 L_src까지만 처리하고 조기 종료해 h^rev를 얻는다. 정방향 영상은 전체를 통과시키며 같은 층에서 h^fwd를 얻고, τ_steer = h^fwd − h^rev를 추출한다. 이 벡터는 정규화하지 않는데, 크기 자체가 입력별 주입 강도를 조절하는 역할을 하기 때문이다. 프레임 순서에 민감한 영상은 큰 보정을, 시간적으로 불변인 입력은 거의 0에 가까운 보정을 받는다. 이후 층 l > L_src에서 마지막 토큰 은닉 상태를 h'_l = h_l + β · w_l · τ_steer로 수정한다. 여기서 w_l = τ̂_l / τ̂_{L_src}는 모델별로 미리 계산해 둔 평균 프로파일에서 나온 층별 주입 스케줄이고, β는 전역 스케일 계수다. 정점 이후에도 시간 성분이 남아 있는 층에는 비례해 크게, 시간 신호가 약해진 깊은 층에는 가볍게 더한다. 프로파일 가중치는 TempCompass의 정·역방향 영상 50쌍으로 모델당 한 번만 계산하며 정답 라벨이 필요 없다. 주입은 마지막 토큰 위치에만 적용되고 다른 토큰 표현과 모델 파라미터는 건드리지 않는다.

전제와 한계

실험은 세 모델에 TAI를 적용해 시간 추론 벤치마크 TempCompass, TVBench, AoTBench와 일반 영상 이해 벤치마크 MVBench에서 평가한다. 비교 대상은 학습 없는 TCD, DINO-HEAL과 학습 기반 ArrowRL이다. 모든 실험은 A6000 GPU 한 장에서 16프레임 균일 시간 샘플링으로 수행했다. 저자들은 TAI가 세 모델과 세 시간 추론 벤치마크 모두에서 베이스라인을 일관되게 앞서며, 학습 없는 방법 중 최고 평균을 기록하고 큐레이션된 시간 보상으로 강화학습을 돌린 ArrowRL과도 Qwen2.5-VL-7B에서 경쟁력 있는 수준에 도달한다고 보고한다. 개선은 방향성 움직임 감지나 사건 순서 정렬처럼 프레임 순서에 민감한 범주에 집중되고, 단일 프레임으로 풀리거나 뒤집기에 불변인 범주에서는 효과가 미미하다. MVBench에서는 시간 관련 그룹이 세 모델 모두 향상되고 비시간·혼합 그룹은 소폭 변동에 그쳐 전체 성능 하락이 없다. 벤치마크별 정확도 표의 세부 수치는 본문에 옮겨져 있지 않지만, 저자들은 일관된 향상만 보고한다.

수치로 확인되는 것은 개입의 특이성이다. β의 부호를 뒤집은 Anti-TAI는 뒤집기에 민감한 세 범주를 선택적으로 악화시킨다. Attribute Change가 36.3%p, Order가 27.4%p, Direction이 12.6%p 떨어지는 반면, 뒤집기에 불변인 Action과 Speed는 베이스라인 대비 1% 이내에 머문다. 범주별 τ̂_{L_src} 값도 개선과 악화의 폭이 추출된 시간 신호의 세기와 함께 움직인다는 것을 보여준다. 절제 실험에서는 β를 0.1에서 1.0까지 0.1 간격으로 훑었을 때 모든 값에서 베이스라인이 개선되고 β=0.5까지 꾸준히 오르다 이후 평탄해진다. 프레임 수를 늘릴수록 이득이 커지다 16프레임 이후 포화되고, 정점 층에서 추출할 때 가장 큰 이득을 얻으며, 단일 층 추출(k=1)이 최선이고 k=3, 5, 7로 넓히면 성능이 완만하게만 떨어진다. 주입 스케줄을 균일하게 주거나 역순으로 주는 것보다 프로파일 기반 스케줄이 낫다. 또한 ArrowRL로 학습된 Qwen2.5-VL-7B 위에 TAI를 얹어도 추가 이득이 나와, 가중치 수준 최적화와 직교한다는 것을 보인다.

개발자 관점에서 이 방법의 실용적 매력은 비용 구조에 있다. 학습도, 가중치 수정도, 정답 라벨도 필요 없고, 모델당 한 번 계산해 두는 프로파일 설정 파일과 입력별 τ_steer 추출만으로 동작한다. 역방향 영상은 정점 층까지만 돌리고 조기 종료하므로 추가 연산도 제한적이다. 다만 실제로 얹기 전에 확인할 것은 세 가지다. 첫째, 대상 모델이 중간층 은닉 상태를 노출하는지, 그리고 마지막 토큰 위치에 개입할 수 있는 훅 지점이 있는지. 둘째, β가 유일한 자유 하이퍼파라미터이므로 모델별로 한 번은 스윕해야 한다는 점. 셋째, 프로파일이 모델의 구조적 속성이라 입력 간 일반화되지만, 대상 모델에서 정점 위치가 어디인지는 직접 측정해 확인해야 한다는 점이다. 시간 순서 판단이 중요한 서비스라면 재학습 없이 시도해볼 가치가 있는 개입이다.

저자들이 밝힌 한계는 범위에 관한 것이다. 이 연구는 프레임의 순차적 배열에서 나오는 시간 정보만 다룬다. 사건 순서, 방향성 움직임, 시간에 따른 속성 변화는 포함하지만, 공간 추론, 객체 상호작용, 오디오-비주얼 대응 같은 영상 이해의 다른 축은 범위 밖이다. τ̂_l 프레임워크는 프레임 순서 반전 외에 다른 대비 쌍을 설계하면 다른 변동 축에도 확장할 수 있겠지만, 저자들은 이를 향후 과제로 남긴다.