반복 언어모델의 추가 루프는 추론을 늘리지만 지식을 깎는다

What Makes Recurrence Effective in Looped Language Models?

HF Daily2609.36636

Xinlin Zhuang, Siyuan Wang, Imran Razzak2026-09-29조회 2

무엇인가

루프 언어모델(LoopLM)은 같은 트랜스포머 블록 묶음을 여러 번 재실행해 파라미터를 늘리지 않고 계산 깊이를 키운다. 추론 시 루프 횟수를 바꾸면 테스트 시점 계산량을 유연하게 조절할 수 있다는 점이 매력이지만, 반복을 언제 더 주면 이득인지, 어느 층을 반복시켜야 하는지, 반복 계산을 어떻게 조건화해야 하는지는 정리되지 않았다. 이 논문은 통제 실험으로 (1) 반복이 도움이 되는 시점, (2) 반복을 적용할 위치, (3) 조건화 방식이 성능에 미치는 영향을 체계적으로 분해한다.

어떻게 동작하나

모델은 프렐류드 P, 파라미터 공유 반복 코어 F, 코다 C로 구성된 M = C ∘ F^K ∘ P 형태로 정의된다. P와 C가 없는 전체 공유 구조를 BaseLoop, 코어 양옆에 비반복 경계 블록을 둔 구조를 CoreLoop라 부른다. 논문은 물리 깊이(서로 다른 층 수)와 유효 깊이(물리 깊이 × 루프 수)를 구분하고, 물리 깊이·학습 유효 깊이·추론 유효 깊이·학습 파이프라인 네 가지를 모두 맞춘 상태에서만 비교한다. Llama3.1-1B와 Qwen3-0.6B 백본을 무작위 초기화해 FineWeb-Edu로 사전학습하고, Chinchilla 비율(파라미터당 20토큰), Muon+AdamW, 2048토큰 시퀀스, 학습 시 고정 루프 K회를 역전파 절단 없이 학습한다. 평가는 지식(SciQ, ARC-Easy, PIQA)과 추론(ARC-Challenge, WinoGrande, OpenBookQA, HellaSwag, CommonsenseQA, ProofWriter, CLUTRR, BBH)으로 나누고, 추론 루프 r을 학습 지평 K보다 작게(언더 언롤링), 같게, 크게(루프 외삽) 설정해 비교한다.

무엇과 다른가

첫 번째 결과는 반복의 효용이 태스크에 따라 갈린다는 것이다. 학습 유효 깊이 20으로 맞춘 BaseLoop 2×10(얕은 물리 코어, 루프 10회)에서 추론 성능은 L(r)=20의 28.52에서 L(r)=40의 31.49로 2.97%포인트 올랐지만, 같은 구간에서 지식 성능은 62.80에서 52.11로 떨어졌다. 난이도가 높다고 더 이득인 것도 아니다. ProofWriter는 L(r)=24로 늘렸을 때 증명 깊이 0~5 전 구간에서 향상되고 깊이 3~5에서 약 7.5%포인트 이득을 봤지만, CLUTRR은 관계 사슬 길이 2에서 31.6, 길이 3에서 23.4로 크게 오른 반면 길이 4~10에서는 이득이 작거나 오히려 감소했다. 깊이 배분도 중요하다. 같은 유효 학습 깊이 20에서 2×10은 일찍 정점을 찍고 더 풀면 나빠졌고, 10×2(깊은 물리 코어, 루프 2회)는 외삽 구간에서 거의 평평했다. 균형 잡힌 5×4는 L(r)=30에서 31.88, 4×5는 L(r)=40에서 31.49까지 올라, 동일 학습 FLOPs의 비반복 베이스라인 NonLoop(20×1)의 추론 점수 30.25를 넘어섰다.

어떻게 쓰나

두 번째는 반복할 계산과 그렇지 않을 계산의 배치다. 비반복 코다 층을 두면(예: 0+2×9+2, 0+3×6+2) 언더 언롤링에서 지식 성능 하락이 크게 완화됐고, 기하 지표상 각도 변화와 상태 변동도 더 안정적이었다. 학습 지평 근처에서는 프렐류드·코다 배분에 성능이 둔감했다. 학습 지평을 넘어서면 지식과 전체 성능은 대체로 나빠지지만 추론은 설정 의존적으로 더 좋아질 수 있었고, 프렐류드에 비반복 용량을 많이 준 구성(2+2×9+0, 5+5×3+0, 4+5×3+1)이 외삽에서 추론을 유지하거나 끌어올렸다. 다만 외삽 구간에서 반복 간 각도 거리와 상대 업데이트 노름은 계속 줄어드는데 상태 분산은 학습 지평 대비 커졌다. 즉 업데이트가 작아진다고 남은 반복이 유용하다는 뜻은 아니다.

전제와 한계

세 번째는 조건화다. Huginn식 초기 상태 주입은 고용량 Dense 변형에서 외삽 시 전체·지식 정확도가 붕괴했고, Scalar·Channel-wise 같은 경량 변형은 붕괴는 피했지만 조건 없는 BaseLoop 대비 이득이 거의 없었다. 저자들은 절대적 과거 벡터 대신 상대적 차이에 조건화하는 히스토리 상태 주입을 제안한다. 각 반복에서 h_{ℓ+1} = F(h_ℓ + Σ_{j=1}^{m_ℓ} B_j(h_{ℓ-j} − h_ℓ))로, 최근 중간 상태와 현재 상태의 차이를 지연별 연산자 B_j로 가중해 더하며, 창 크기 m_ℓ = min{w, max(ℓ−1,0)}로 최근 상태만 본다. h_0는 의도적으로 제외해 정적 입력 주입과 분리한다. 4×7 BaseLoop에서 Dense 매핑에 창 w=1을 쓰면 붕괴에서 회복해 NonLoop 수준을 유지했지만, w=2나 4로 늘리면 외삽 성능이 점점 나빠졌고 Scalar·Channel-wise에서는 이득이 제한적이었다. 타임스텝 조건화는 루프 게이팅(LG), 어텐션·MLP 잔차 브랜치에 별도 스칼라 게이트를 두는 브랜치 게이팅(BG), RMSNorm 출력에 채널별 스케일링을 적용하는 AdaLN 세 가지로 구현되며, 추론 시 t_ℓ = ℓ/L_infer, Δt = 1/L_infer로 같은 [0,1] 구간을 더 잘게 나눈다. 7×4에서 L(r)=56일 때 BG 38.46, LG 36.91로 BaseLoop 36.59를 넘었고, BG는 AdaLN(38.01)보다 전체·추론(30.88 대 29.12)에서 앞섰다. 그러나 같은 기법이 4×7, 2×14에서는 이득이 작거나 음수였다.

조건화 기법의 조합 가능성도 실험했다. Qwen3-0.6B BaseLoop 4×7에서 학습 깊이의 3배인 D=84까지 늘렸을 때 히스토리+LG 조합이 전체 37.30으로 초기상태+히스토리(36.91), 초기상태+LG(36.33)를 앞섰고 세 가지를 모두 넣으면 오히려 H+LG보다 낮았다. 저자들은 이를 설명하기 위해 앞선 블록을 건너뛴 뒤 하류 블록 업데이트가 얼마나 변하는지를 재는 계산 상호작용 C를 도입한다. 코다 층은 터미널 대 코어 응답 비율을 0.85~0.89에서 0.48~0.50으로 낮췄고, D=84에서 채널별 초기상태 주입은 Dense 대비 약 7배의 교차 루프 응답을 보였다. H+LG는 지연 1~6 구간 평균 상호작용이 I+H보다 18.6%, I+LG보다 10.4% 높았고, H+LG에 초기상태를 더하면 D=56과 84에서 지연 2~6 평균 상호작용이 각각 7.4%, 4.2% 줄었다.

개발자 관점에서 이 논문은 테스트 시점 계산 확장을 공짜 성능 향상으로 가정하지 말라고 말한다. 지식형 태스크에 루프를 더 풀면 손해이고, 추론형에서도 관계 사슬이 긴 어려운 문제가 자동으로 더 이득을 보지 않는다. 물리 깊이와 루프 수를 균형 있게 잡고, 출력 쪽에 비반복 코다를 두어 언더 언롤링을 견디게 하며, 외삽을 노린다면 입력 쪽 비반복 용량과 히스토리 상태·타임스텝 조건화를 함께 검토하는 것이 논문이 제시하는 실무 지침이다. 조건화 기법의 효과는 반복 구조와 목표 추론 예산에 따라 달라지므로, 학습 지평 하나만 보고 선택하면 안 된다.

한계도 분명하다. 모든 실험은 1B·0.6B급 백본을 무작위 초기화해 처음부터 사전학습한 통제 환경이며, 학습 시 루프 수 K를 고정하고 적응적 정지나 조기 종료 없이 K회를 전부 역전파한다. 토큰 예산은 Chinchilla 비율 20토큰/파라미터를 따르고, 평가는 지식·추론 두 그룹으로 나눈 영어 벤치마크에 한정된다. 저자들 스스로도 프렐류드 우세 배치의 외삽 이득이나 타임스텝 게이팅의 효과가 모든 설정에서 보편적이지 않다고 밝히고 있으며, 초기 상태 주입이 교차 루프 이득을 주지 못한다는 패턴도 모든 지연과 게이팅 변형에 일반화되지는 않는다고 적고 있다.