InfiLoop는 반복 추론에서 최신 상태만 넘기지 않고 과거 계산을 선택적으로 누적한다
Scaling to Tens of Thousands of Test-Time Iterations with Loop-Native Attention Residuals
무엇인가
이 논문은 루프 트랜스포머가 테스트 타임에 반복 횟수를 늘릴수록 오히려 추론 정확도가 떨어질 수 있다는 문제를 다룬다. 기존의 carry-last 규칙은 각 반복의 최신 블록 출력을 다음 반복의 상태로 그대로 넘기는데, 저자들은 이 상태 교체 규칙이 깊은 루프 모델의 핵심 병목이라고 주장한다. 노이즈가 있는 상태 업데이트가 올바른 중간 추론을 덮어쓰고, 이미 완성된 해답을 되돌리며, 초기 루프에서 생긴 오류가 장거리 전파를 거쳐 이후 루프에서 복구되기 어렵게 만든다는 것이다. Sudoku-Extreme 진단에서 carry-last 기반 TRM은 468층에서 62.2%로 최고 정확도를 찍은 뒤 1,872층에서 58.1%로 하락했지만, InfiLoop는 같은 깊이에서 90.9%까지 계속 개선됐다. 업데이트 36~72 구간에서 TRM은 퍼즐당 77.0개의 예측을 바꾸고 오답 셀을 0.21개 늘렸고, InfiLoop는 24.0개를 바꾸면서 오답 셀을 1.25개 줄였다. 업데이트 36에서 두 모델이 맞힌 142만 개의 초기 빈 칸 중 TRM은 20.9%를 한 번 이상 오답으로 바꿨고 InfiLoop는 2.4%만 바꿨다. TRM은 해결 후 9업데이트부터 정답을 잃기 시작해 36업데이트 뒤 19.7%를 잃었지만, InfiLoop가 해결한 퍼즐은 36업데이트 뒤에도 모두 해결 상태로 남았다.
어떻게 동작하나
제안 방법인 InfiLoop는 carry-last를 학습된 반복 출력 어텐션으로 대체한다. 각 토큰 위치에서 후보 상태 z_i가 생성될 때 공유 의사 쿼리 q로 한 번 점수화하고, s_i = q^T RMSNorm(z_i)를 콘텐츠 점수로 쓴다. 다음 반복에 넘길 상태는 h_t = sum_i alpha_{t,i} z_i이며, alpha_{t,i}는 exp(s_i - lambda(t-i))를 모든 후보에 대해 정규화한 값이다. 여기서 lambda는 학습되는 시간 감쇠율이고 beta = e^{-lambda}다. 이 가중 합은 N_t = beta N_{t-1} + e_t z_t, D_t = beta D_{t-1} + e_t, h_t = N_t / D_t라는 정확한 스트리밍 재귀로 계산된다. 이는 h_t = h_{t-1} + gamma_t (z_t - h_{t-1}), gamma_t = e_t / (beta D_{t-1} + e_t)인 적응적 잔차 업데이트로 해석된다. gamma_t가 0과 1 사이이므로 새 후보의 콘텐츠 점수가 높으면 크게 받아들이고, 낮으면 이전 상태를 보존한다. 집계 상태는 후보들의 볼록 껍질 안에 있어 가장 큰 후보의 노름을 넘지 않는다. 메모리는 토큰당 O(d) 벡터 N과 스칼라 D만 필요해 반복 횟수와 무관하게 일정하고, 반복당 계산도 O(d), 전체 집계 비용은 O(Td)다. 반면 반복별 쿼리를 쓰는 Full Attention Residuals는 t단계에서 O(td) 메모리와 계산, 전체 O(T^2 d) 비용이 든다. 이 규칙은 표준 루프 트랜스포머와 TRM, HRM 같은 중첩 순환 추론기에도 적용되며, 각 순환 축마다 별도의 q, beta, N, D를 두고 축당 d+1개의 학습 파라미터를 추가한다.
무엇과 다른가
실험은 7M 파라미터의 중첩 루프 추론기로 수행됐다. 공유 블록은 은닉 차원 512의 트랜스포머 2층, 8개 어텐션 헤드, 확장 계수 4의 SwiGLU, depthwise 3x3 합성곱으로 구성된다. 비교 대상은 carry-last를 쓰는 TRM-Att 7M, 고정점 감쇠를 쓰는 FPRM 7M, HRM, Attractor Models, EqR, URM 7M~27M, 그리고 테스트 타임 체인오브소트를 쓰는 프런티어 추론 LLM이다. Sudoku-Extreme에서 InfiLoop는 97.9% exact accuracy를 기록해 FPRM 94.2%, TRM-Att 74.7%, 저자들이 재학습한 TRM 73.6%를 앞섰다. Maze-Hard에서는 87.4%로 TRM-Att 85.3%, FPRM 87.0%를 넘었다. ARC-AGI-1에서는 49.1% pass@2로 FPRM 47.5%, TRM-Att 44.6%를 앞섰고, ARC-AGI-2에서는 13.6% pass@2로 TRM-Att 7.8%, FPRM 6.2%를 거의 두 배 차이로 앞섰다. 공개된 ARC-AGI-2 검증 체크포인트는 같은 프로토콜에서 4.6% pass@2를 기록했다.
어떻게 쓰나
테스트 타임 깊이와 계산 효율에서도 InfiLoop는 더 적은 층으로 더 높은 정확도를 낸다. 1,872층 평가에서 InfiLoop는 90.9%를 달성했는데, FPRM은 3,744층에서 90.1%에 도달해 InfiLoop가 절반의 계산으로 앞선다. 3,744층에서 맞춘 비교에서는 InfiLoop 92.4%, FPRM 90.1%다. InfiLoop가 936층에서 낸 86.5%는 TRM이 24,960층에서 낸 83.65%보다 높다. 24,960층 평가에서 정확도는 InfiLoop 92.74%, FPRM 91.63%, TRM 83.65%다. Sudoku 난이도별로는 빈 칸 45~51개에서 InfiLoop와 FPRM 모두 100.0%였고, 52개에서 InfiLoop 100.0% 대 FPRM 96.5%, TRM 95.8%였다. 55개에서는 93.4% 대 90.3%, 84.2%였고, 58개에서는 84.1% 대 77.9%, TRM 64.5%였다. 가장 어려운 60개 빈 칸에서는 InfiLoop 59.5%, FPRM 56.5%, TRM 36.0%였다. 논문은 Sudoku-Extreme에서 20,000 유효 스텝을 넘겨도 테스트 타임 루프가 계속 개선된다고 보고한다.
전제와 한계
학습된 연결의 동역학도 분석됐다. 모든 블록 출력에 같은 가중치를 주면 gamma_t는 1 - beta = 0.56으로 수렴하는데, 해결 전 평균 스텝 크기는 약 0.40으로 억제된다. 퍼즐을 완성하는 업데이트에서 스텝 크기가 0.91로 치솟아 새 해답에 지배적 가중치를 주고, 이후 6업데이트 안에 0.56으로 돌아온다. 해결되지 않은 퍼즐에서는 계속 억제된 상태로 남는다. 콘텐츠 점수는 정답 보드에서 중앙값 7.25로 상한 클리핑 8.0에 가깝고, 오답 셀 20개에서 2.75, 33개에서 -0.58로 떨어진다. 콘텐츠 점수를 제거하면 학습 또는 테스트 시 정확도가 6~7%포인트 낮아진다. 업데이트 36에서 상대 섭동 10^{-4}~0.3을 주입하고 36업데이트를 더 돌린 실험에서 InfiLoop는 모든 섭동 규모에서 해결된 퍼즐 100%를 유지했지만, TRM은 섭동이 없어도 15~20%의 해답을 잃었다. TRM은 10^{-4}의 최소 섭동만으로도 12업데이트 안에 궤적이 상대 거리 1 정도로 발산했고, InfiLoop는 변위가 유계로 유지됐다.
설계 선택 실험도 있다. 중첩 추론기의 내부 루프와 외부 루프 중 한쪽에만 연결을 적용한 경우보다 양쪽 축에 모두 적용한 경우가 모든 예산에서 가장 높았다. H3 L6 훈련 깊이에서 양축 적용은 82.1%로 내부만 72.6%, 외부만 75.1%를 앞섰고, H32 L6에서는 89.7% 대 79.4%, 80.0%로 격차가 커졌다. 시간 감쇠 초기화에서는 역방향 감쇠 beta=1.82가 H3 L6에서 2.0%에 그쳤고, 균일 가중 beta=1은 38.4%, 순방향 감쇠 beta=0.55는 74.0%였다. beta를 0.55에서 학습하면 H3 L6 82.1%, H32 L6 89.7%로 가장 좋았고, beta0=0.10은 66.3%, beta0=0.90은 63.3%였다. 저자들은 모든 벤치마크에서 beta0=0.55의 순방향 감쇠를 학습한다.
개발자 관점에서 이 논문은 루프형 추론 모델을 만들 때 최신 상태만 다음 반복으로 넘기는 기본 규칙을 그대로 두면 테스트 타임 계산을 늘려도 성능이 꺾일 수 있음을 보여준다. 긴 추론 예산을 다루는 시스템이라면 상태 집계를 콘텐츠 기반 점수와 시간 감쇠로 바꾸고, 집계 메모리가 반복 횟수에 따라 커지지 않는지 확인해야 한다. 다만 실험은 7M 파라미터의 작은 모델과 Sudoku, Maze, ARC 같은 특정 벤치마크에 집중되어 있어, 더 큰 언어모델이나 일반 도메인으로 그대로 전이된다고 단정할 수는 없다. 원문은 별도의 한계 절을 제시하지 않지만, 정확한 재귀는 공유 스코어러와 지수 시간 감쇠를 전제로 하고, 임의 반복에 대한 균일한 노름 상한을 위해서는 후보 상태의 노름이 유계로 유지되어야 한다고 밝힌다. 집계가 후보 중 가장 큰 노름을 넘지 않는다는 성질도 후보 노름이 폭주하지 않는다는 조건 아래에서 의미가 있다.