루프 트랜스포머의 반복 추론에서 업데이트 크기를 궤적에 맞춰 조절한다

Scheduling Recursive Reasoning in Looped Transformers

HF Daily2609.36653

Boyuan Wang, Chengyao Yu, Jiaxi Ren2026-09-29조회 2

무엇인가

반복 추론(recurrent reasoning) 모델은 같은 변환을 잠재 상태에 되풀이 적용해 파라미터 수와 무관하게 추론 깊이를 늘린다. 기존 연구는 무엇을 반복하는지(아키텍처)와 몇 번 반복하는지(깊이)에 집중했고, 각 반복에서 상태를 얼마나 멀리 움직일지, 즉 업데이트 크기는 사실상 손대지 않았다. 표준 추론은 궤적 전체에 걸쳐 η=1인 단위 스텝을 쓴다. 논문은 이 선택이 업데이트가 꾸준히 진전할 때는 지나치게 보수적이고, 업데이트가 요동칠 때는 지나치게 공격적이라고 지적한다. 이상적으로는 각 스텝 크기를 최종 과제 손실에 대한 효과로 정해야 하지만, 추론 시점에는 정답 y도 하류 그래디언트도 없어 그 신호를 쓸 수 없다. 그래서 저자들은 관측 가능한 궤적 자체에 그 정보가 있는지 묻는다.

어떻게 동작하나

문제 설정은 명확하다. 인코더가 만든 초기 상태 X0에서 같은 코어 Φθ를 반복 적용하되, X_{k+1} = X_k + η_k Δθ(X_k; u)로 스텝 크기 η_k를 도입한다. η_k=1이면 기존 루프, 1보다 크면 과이완(over-relaxation), 작으면 감쇠다. Proposition 1은 각 η_k가 최종 손실에 미치는 민감도를 ∂L/∂η_k = <G_{k+1}, Δ_k>로 정확히 준다. 여기서 G는 역방향으로 전파한 그래디언트다. A_k = -<G_{k+1}, Δ_k>로 두면 A_k>0일 때 η_k를 키우는 게 손실을 줄인다. Proposition 2는 이 민감도를 시간 창으로 평균 낸 값이 Ā_k^w = P_k^w - S_k^w로 정확히 분해됨을 보인다. P는 궤적을 따라 누적되는 지속적 진전, S는 평균을 뺀 중심화 요동 기여다. 즉 "꾸준히 나아가면 크게, 요동치면 작게"라는 원리가 최종 손실과 연결된다.

무엇과 다른가

TAPS(Trajectory Adaptive Progress–Fluctuation Scheduler)는 이 원리를 온라인으로 구현한다. 학습된 업데이트 Δ_k의 지수이동평균 M_k와 제곱평균 v_k를 추적해 P̂_k = ||M_k||²/(nd), Ŝ_k = v_k - P̂_k를 계산한다. P̂는 업데이트의 지속적 운동 에너지, Ŝ는 시간적 요동을 나타낸다. 두 에너지를 B̂_k = (P̂_k - γŜ_k)/(P̂_k + γŜ_k + ε_num) ∈ [-1,1]로 결합하고, η_k = clip(1 + ρB̂_k, η_min, η_max)로 스텝 크기를 정한다. 워밍업 구간 K_warm 동안은 η=1로 두면서 통계만 갱신한다. γ는 요동의 상대 가중치, ρ는 적응 폭, ε_num은 수치 안정화 항이다. 저자들은 이 인스턴스를 TAPS(Adam)라 부르고, P와 S 추정 방식과 η 매핑을 바꾼 TAPS(GD), TAPS(BB) 변형도 함께 제시한다.

어떻게 쓰나

이론적으로 Theorem 3은 관측 에너지가 오라클 기여와 조건부로 비교 가능하다는 가정(식 4)과 창 평균과 순간 민감도의 드리프트 한계(식 5) 아래에서, B̂_k의 부호가 η_k를 키워야 하는지 줄여야 하는지를 정확히 알려준다는 충분조건을 준다. Theorem 4는 선택한 η_k가 조건부 기대 최종 손실을 실제로 줄이는 1-인자 이득 하한을 유도하고, Theorem 5는 누적 이득 하한 G_K^lb를 통해 J_K(π) ≤ J_K(π0) - G_K^lb, 나아가 K_ε(π) < K_ε(π0)를 보인다. 즉 단위 스텝 정책이 아직 목표 품질에 도달하지 못한 반복 수 K에서 TAPS는 도달할 수 있다.

전제와 한계

실험은 세 가지 반복 구조를 다룬다. 잠재 상태 반복(TRM), 언어모델 반복(Ouro-1.4B, Huginn-0125, 추가로 Ouro-2.6B), 중간층 반복(Qwen3-4B-Instruct의 특정 층을 반복 적용, 가중치 동결). 추론 전략은 단위 스텝, 적응적 종료(FPRM), 고정점 추론, 병렬 반복 추론(PTRM) 네 가지다. 재학습 없이 적용한 추론 전용 TAPS는 여섯 변형 모두 Sudoku와 Maze에서 최종 정확도를 높이고 단위 스텝 베이스라인의 최종 성능에 더 짧은 시간에 도달했다. 고정 스케일은 반대로 일관된 개선을 내지 못했다. 학습-추론 공동 설계는 L_co = L_task + L_ACT + μ Σ_k [Ŝ_k - κP̂_k]_+ 로 요동이 지속적 진전을 넘어설 때만 벌점을 준다. 그 결과 Sudoku에서 91.39% 정확도에 1.300× 속도 향상, Maze에서 79.90%에 1.561× 속도 향상을 얻었고, 단위 스텝 기준은 각각 89.67%, 78.80%였다. 적응적 종료에서는 91.2% Exact를 316.5회 유효 업데이트로 달성해, 비슷한 정확도(91.1%)의 FPRM보다 4.7× 적은 연산을 썼다. 고정점 추론에서는 1,000회 업데이트로 얻는 정확도를 약 260회 만에 맞췄다. 계층적 반복(TRM/HRM)에서는 내부 루프와 외부 루프 양쪽에서 이득이 났고, 스케일 갱신 주기 q를 키우면 컨트롤러 평가는 줄지만 궤적 추적이 거칠어져 같은 정확도에 더 많은 반복이 필요하다는 비단조 트레이드오프가 나타났다. 언어모델 반복에서도 여섯 변형 모두 평균 정확도를 올렸고, 중간층 반복에서는 모든 컨트롤러가 평균 η̄ > 1을 선택해 이 설정이 완만한 과이완을 선호함을 보였다.

개발자 관점에서 이 논문의 실용적 요점은 제어 축이 하나 늘어난다는 것이다. 아키텍처가 무엇을 반복할지, 깊이가 얼마나 오래 반복할지를 정한다면, 업데이트 크기는 각 스텝을 얼마나 강하게 적용할지를 정한다. TAPS는 가중치를 수정하지 않고 추론 루프에 EMA 통계 몇 개와 클리핑만 추가하는 형태라 기존 반복 추론 스택에 얹기 쉽다. 다만 γ, ρ, η_min, η_max, β, K_warm 같은 하이퍼파라미터가 있고, 논문에서도 변형마다 태스크별 순위가 달랐다는 점은 실제 도입 시 자신의 워크로드에서 스윕이 필요하다는 뜻이다. 또한 적응적 종료와 결합할 때는 궤적 이력이 충분히 쌓인 뒤에야 종료 판단이 신뢰할 만해진다는 관찰도 고려해야 한다.

저자들이 밝힌 한계는 세 가지다. 첫째, 이론이 궤적 통계와 과제 기여를 연결하는 조건(식 4, 5)에 의존하므로 이를 더 넓은 반복 동역학으로 확장하는 것이 남은 과제다. 둘째, TAPS는 현재 국소 궤적 통계만 관측 가능한 대리 신호로 쓰고 있어 더 풍부한 신호를 넣으면 제어가 개선될 여지가 있다. 셋째, 학습-추론 공동 설계는 스텝 크기 스케줄링을 위해 반복 동역학을 형성하는 첫걸음일 뿐이며, 학습 과정과 더 넓은 아키텍처로의 깊은 통합은 향후 연구로 남겨 두었다.