루프 트랜스포머의 반복 추론에서 업데이트 크기를 궤적에 맞춰 조절한다
Scheduling Recursive Reasoning in Looped Transformers
무엇인가
반복 추론(recurrent reasoning) 모델은 같은 변환을 잠재 상태에 되풀이 적용해 파라미터 수와 무관하게 추론 깊이를 늘린다. 기존 연구는 무엇을 반복하는지(아키텍처)와 몇 번 반복하는지(깊이)에 집중했고, 각 반복에서 상태를 얼마나 멀리 움직일지, 즉 업데이트 크기는 사실상 손대지 않았다. 표준 추론은 궤적 전체에 걸쳐 η=1인 단위 스텝을 쓴다. 논문은 이 선택이 업데이트가 꾸준히 진전할 때는 지나치게 보수적이고, 업데이트가 요동칠 때는 지나치게 공격적이라고 지적한다. 이상적으로는 각 스텝 크기를 최종 과제 손실에 대한 효과로 정해야 하지만, 추론 시점에는 정답 y도 하류 그래디언트도 없어 그 신호를 쓸 수 없다. 그래서 저자들은 관측 가능한 궤적 자체에 그 정보가 있는지 묻는다.
어떻게 동작하나
문제 설정은 명확하다. 인코더가 만든 초기 상태 X0에서 같은 코어 Φθ를 반복 적용하되, X_{k+1} = X_k + η_k Δθ(X_k; u)로 스텝 크기 η_k를 도입한다. η_k=1이면 기존 루프, 1보다 크면 과이완(over-relaxation), 작으면 감쇠다. Proposition 1은 각 η_k가 최종 손실에 미치는 민감도를 ∂L/∂η_k = <G_{k+1}, Δ_k>로 정확히 준다. 여기서 G는 역방향으로 전파한 그래디언트다. A_k = -<G_{k+1}, Δ_k>로 두면 A_k>0일 때 η_k를 키우는 게 손실을 줄인다. Proposition 2는 이 민감도를 시간 창으로 평균 낸 값이 Ā_k^w = P_k^w - S_k^w로 정확히 분해됨을 보인다. P는 궤적을 따라 누적되는 지속적 진전, S는 평균을 뺀 중심화 요동 기여다. 즉 "꾸준히 나아가면 크게, 요동치면 작게"라는 원리가 최종 손실과 연결된다.
무엇과 다른가
TAPS(Trajectory Adaptive Progress–Fluctuation Scheduler)는 이 원리를 온라인으로 구현한다. 학습된 업데이트 Δ_k의 지수이동평균 M_k와 제곱평균 v_k를 추적해 P̂_k = ||M_k||²/(nd), Ŝ_k = v_k - P̂_k를 계산한다. P̂는 업데이트의 지속적 운동 에너지, Ŝ는 시간적 요동을 나타낸다. 두 에너지를 B̂_k = (P̂_k - γŜ_k)/(P̂_k + γŜ_k + ε_num) ∈ [-1,1]로 결합하고, η_k = clip(1 + ρB̂_k, η_min, η_max)로 스텝 크기를 정한다. 워밍업 구간 K_warm 동안은 η=1로 두면서 통계만 갱신한다. γ는 요동의 상대 가중치, ρ는 적응 폭, ε_num은 수치 안정화 항이다. 저자들은 이 인스턴스를 TAPS(Adam)라 부르고, P와 S 추정 방식과 η 매핑을 바꾼 TAPS(GD), TAPS(BB) 변형도 함께 제시한다.
어떻게 쓰나
이론적으로 Theorem 3은 관측 에너지가 오라클 기여와 조건부로 비교 가능하다는 가정(식 4)과 창 평균과 순간 민감도의 드리프트 한계(식 5) 아래에서, B̂_k의 부호가 η_k를 키워야 하는지 줄여야 하는지를 정확히 알려준다는 충분조건을 준다. Theorem 4는 선택한 η_k가 조건부 기대 최종 손실을 실제로 줄이는 1-인자 이득 하한을 유도하고, Theorem 5는 누적 이득 하한 G_K^lb를 통해 J_K(π) ≤ J_K(π0) - G_K^lb, 나아가 K_ε(π) < K_ε(π0)를 보인다. 즉 단위 스텝 정책이 아직 목표 품질에 도달하지 못한 반복 수 K에서 TAPS는 도달할 수 있다.
전제와 한계
실험은 세 가지 반복 구조를 다룬다. 잠재 상태 반복(TRM), 언어모델 반복(Ouro-1.4B, Huginn-0125, 추가로 Ouro-2.6B), 중간층 반복(Qwen3-4B-Instruct의 특정 층을 반복 적용, 가중치 동결). 추론 전략은 단위 스텝, 적응적 종료(FPRM), 고정점 추론, 병렬 반복 추론(PTRM) 네 가지다. 재학습 없이 적용한 추론 전용 TAPS는 여섯 변형 모두 Sudoku와 Maze에서 최종 정확도를 높이고 단위 스텝 베이스라인의 최종 성능에 더 짧은 시간에 도달했다. 고정 스케일은 반대로 일관된 개선을 내지 못했다. 학습-추론 공동 설계는 L_co = L_task + L_ACT + μ Σ_k [Ŝ_k - κP̂_k]_+ 로 요동이 지속적 진전을 넘어설 때만 벌점을 준다. 그 결과 Sudoku에서 91.39% 정확도에 1.300× 속도 향상, Maze에서 79.90%에 1.561× 속도 향상을 얻었고, 단위 스텝 기준은 각각 89.67%, 78.80%였다. 적응적 종료에서는 91.2% Exact를 316.5회 유효 업데이트로 달성해, 비슷한 정확도(91.1%)의 FPRM보다 4.7× 적은 연산을 썼다. 고정점 추론에서는 1,000회 업데이트로 얻는 정확도를 약 260회 만에 맞췄다. 계층적 반복(TRM/HRM)에서는 내부 루프와 외부 루프 양쪽에서 이득이 났고, 스케일 갱신 주기 q를 키우면 컨트롤러 평가는 줄지만 궤적 추적이 거칠어져 같은 정확도에 더 많은 반복이 필요하다는 비단조 트레이드오프가 나타났다. 언어모델 반복에서도 여섯 변형 모두 평균 정확도를 올렸고, 중간층 반복에서는 모든 컨트롤러가 평균 η̄ > 1을 선택해 이 설정이 완만한 과이완을 선호함을 보였다.
개발자 관점에서 이 논문의 실용적 요점은 제어 축이 하나 늘어난다는 것이다. 아키텍처가 무엇을 반복할지, 깊이가 얼마나 오래 반복할지를 정한다면, 업데이트 크기는 각 스텝을 얼마나 강하게 적용할지를 정한다. TAPS는 가중치를 수정하지 않고 추론 루프에 EMA 통계 몇 개와 클리핑만 추가하는 형태라 기존 반복 추론 스택에 얹기 쉽다. 다만 γ, ρ, η_min, η_max, β, K_warm 같은 하이퍼파라미터가 있고, 논문에서도 변형마다 태스크별 순위가 달랐다는 점은 실제 도입 시 자신의 워크로드에서 스윕이 필요하다는 뜻이다. 또한 적응적 종료와 결합할 때는 궤적 이력이 충분히 쌓인 뒤에야 종료 판단이 신뢰할 만해진다는 관찰도 고려해야 한다.
저자들이 밝힌 한계는 세 가지다. 첫째, 이론이 궤적 통계와 과제 기여를 연결하는 조건(식 4, 5)에 의존하므로 이를 더 넓은 반복 동역학으로 확장하는 것이 남은 과제다. 둘째, TAPS는 현재 국소 궤적 통계만 관측 가능한 대리 신호로 쓰고 있어 더 풍부한 신호를 넣으면 제어가 개선될 여지가 있다. 셋째, 학습-추론 공동 설계는 스텝 크기 스케줄링을 위해 반복 동역학을 형성하는 첫걸음일 뿐이며, 학습 과정과 더 넓은 아키텍처로의 깊은 통합은 향후 연구로 남겨 두었다.