루프 트랜스포머가 버리던 중간 반복 상태로 추론 성능을 끌어올리는 LoopCD

Decoding Looped Transformers Better for (Almost) Free

arXiv2610.02185v1

Weihao Liu2026-10-01

무엇인가

루프 트랜스포머는 파라미터를 공유하는 블록을 여러 번 반복 실행해 파라미터 수를 늘리지 않고 유효 깊이와 계산량을 키우는 구조다. 생성 과정에서 각 반복은 같은 다음 토큰에 대해 디코딩 가능한 중간 표현을 만들어내지만, 표준 자동회귀 디코딩은 마지막 반복이 낸 상태만 사용하고 그 이전 상태들은 버린다. 이 논문은 여기에 주목한다. 반복이 적은 초기 상태는 계산량이 적은 만큼 자연히 더 약한 예측에 해당하고, 같은 파라미터 블록이 같은 표현 공간에서 만들어낸 것이므로 별도 소형 모델이나 프롬프트 변형 없이도 정렬된 약한-강한 예측 쌍이 공짜로 생긴다는 것이다.

어떻게 동작하나

제안 방법 LoopCD는 첫 반복 상태 h1을 약한 참조로, 최종 반복 상태 hR을 강한 예측으로 놓고 참조로부터 멀어지는 방향으로 외삽한다. 구현은 두 가지다. LoopCD-Hidden은 coda 층 이전의 은닉 상태 공간에서 h' = hR + ω(hR − h1)로 두 상태를 결합한 뒤 coda와 lm_head를 통과시킨다. 결합이 출력층 앞에서 일어나므로 기준선과 동일하게 출력 패스를 한 번만 수행하며 추가 오버헤드가 없다. LoopCD-Logits는 coda와 lm_head를 통과한 뒤 얻은 로짓 z1과 zR을 z' = zR + ω(zR − z1)로 대조하는데, 참조 로짓 z1을 계산하기 위해 출력 패스가 한 번 더 필요하다. 두 경우 모두 ω = 0이면 비유도 기준선과 같아진다.

무엇과 다른가

유도 강도 ω는 고정값으로 쓸 수도 있고, 토큰마다 적응적으로 정할 수도 있다. 적응형 규칙은 비유도 예측의 상위 두 토큰 확률 pR,(1), pR,(2)의 마진을 이용해 ω = ωmax[1 − (pR,(1) − pR,(2))]로 정한다. 두 후보가 팽팽하면 최대 강도에 가까워지고 한 후보가 지배적이면 유도가 줄어든다. 전체 어휘에 대한 엔트로피를 계산하지 않아도 된다는 것이 저자들의 설명이다. 다만 적응형 규칙은 zR을 이미 계산해 둔 LoopCD-Logits에만 적용되고, LoopCD-Hidden은 고정 강도를 쓴다.

어떻게 쓰나

실험은 Ouro, Huginn, Parcae, Looped-Qwen3(Qwen3-4B 기반) 네 모델군에서 이뤄졌다. 전체 반복 깊이에서 LoopCD-Logits의 적응형 규칙은 Ouro-2.6B-Thinking의 AIME 2024 pass@1을 61.88%에서 73.33%로, AIME 2025 pass@1을 49.58%에서 56.88%로, OlympiadBench pass@1을 64.05%에서 67.29%로 올렸다. 고정·적응 규칙 모두 pass@1에서 5.27~7.33점, pass@10에서 2.53~4.12점의 향상을 냈다. 코드 생성에서는 Huginn-0125의 R=32에서 적응형 LoopCD-Logits가 HumanEval pass@1을 23.17%에서 28.66%로, R=16에서 20.12%에서 28.05%로 올렸고, LoopCD-Hidden은 R=32에서 22.56%에서 31.71%로, R=16에서 21.95%에서 28.05%로 올려 로짓 방식보다 컸다. 객관식 7개 벤치마크(ARC-Challenge, ARC-Easy, SciQ, MMLU, HellaSwag, WinoGrande, PIQA) 평균에서도 LoopCD-Hidden은 Huginn의 R=32와 R=16에서 각각 +0.83, +0.75점을 더해 고정 LoopCD-Logits의 +0.74, +0.62를 앞섰고 Parcae-1.3B에서 +0.85점을 기록했다. 코드 생성 4개 열 평균은 R=32에서 +5.13점, R=16에서 +3.76점이었다.

전제와 한계

이득은 반복 횟수를 줄이는 데도 쓰인다. 반복을 절반으로 줄이면 비유도 상태에서는 객관식 평균이 0.17~1.29점 떨어지는데, 이 깊이에서 LoopCD를 적용하면 0.75~1.29점이 더해져 Huginn, Parcae, Looped-Qwen3의 여섯 개 설정 모두에서 손실을 메운다. Huginn-0125는 32회 중 16회만 실행하고도 전체 깊이 비유도 기준선을 LoopCD-Logits로 1.02점, LoopCD-Hidden으로 0.51점 앞섰고, Looped-Qwen3는 절반 반복에서 LoopCD-Hidden으로 전체 깊이 기준선과 동일한 점수(+0.00)를 냈다. 유도 오버헤드를 모두 포함해도 절반 깊이 유도 모델은 원래 순전파 FLOPs의 0.52~0.78만 요구하며, 전체적으로 동등하거나 더 나은 정확도에서 순전파 FLOPs를 22.5%에서 48.2%까지 없앤다.

메커니즘 분석도 제시된다. 첫 반복의 예측은 7개 벤치마크 평균에서 최종 예측보다 4.0~23.7점 뒤처지고, 반복이 진행되며 정확도가 올라간다. 최종 예측과의 발산은 Ouro-1.4B에서 첫 패스 후 0.71비트에서 세 번째 후 0.013으로, Huginn에서 첫 스텝 3.0낫에서 열여섯 번째 0.04로 줄어든다. Huginn의 첫 스텝은 ARC-Challenge 문제의 51%에서 최종 예측과 다른 선택지를 골랐고 ω=0.5에서 3.07점을 냈지만, 열여섯 번째는 7%만 달랐고 0.17점에 그쳤다. 로짓 대조를 zR에 평행한 성분과 직교 성분으로 나누면 평행 성분은 순서를 보존하는 온도 스케일링, 직교 성분은 순수한 재순위화로 작동하며, HellaSwag에서 직교 성분만 적용해도 ω=1.5까지 전체 업데이트와 같거나 더 큰 이득을 냈다(Ouro-1.4B ω=0.5에서 +1.72 대 +0.76, Ouro-2.6B에서 +2.27 대 +1.56). 유도는 확신이 낮은 문제에 집중된다. ω=0.5에서 ARC-Challenge의 가장 불확실한 5분위 문제에는 +6.4~+13.3점이 더해지지만 가장 확신하는 5분위에는 최대 +0.4점에 그친다. 실제로 뒤집히는 답은 5.8~14.9%뿐이고 순이득 2.1~3.5점은 모두 팽팽한 결정을 해소한 데서 나온다.

실무 관점에서 LoopCD는 체크포인트 재학습이나 별도 소형 모델 없이 디코딩 코드만 바꿔 적용할 수 있다는 점이 핵심이다. 다만 강도 설정이 과제에 따라 다르다. 객관식 채점은 ω=0.5 근처를 정점으로 넓은 범위에서 이득이 유지되지만, 자동회귀 생성은 ω ∈ [0.2, 0.3]의 좁은 구간을 요구한다. 초기 토큰의 변화가 생성된 접두사 전체에 누적되기 때문에 큰 강도에서는 성능이 급격히 떨어진다. 적응형 마진 게이팅은 ωmax ∈ [0.5, 1.0]의 넓은 범위에서 양의 이득을 유지해 고정 강도가 과도하게 튀는 상황을 완화한다. 또한 ω < 0으로 약한 참조 쪽으로 이동하면 두 과제군 모두에서 정확도가 떨어진다.

저자들이 밝힌 전제와 한계도 분명하다. LoopCD는 파라미터를 공유하는 반복 블록을 가진 루프 트랜스포머를 전제로 하며, 이득의 크기는 초기 참조가 최종 예측과 얼마나 sharply 어긋나는지에 달려 있다. 이미 수렴한 후반 반복은 참조로 쓸 방향을 거의 남기지 않아 더 큰 강도가 필요하다. LoopCD-Hidden의 경우 Huginn은 가우시안 노이즈에서 초기화되어 coda가 로짓에서는 밀어내지만 투영되지 않은 은닉 대조는 훼손하므로, 초기 은닉 상태는 −0.58점을 내다가 여섯 번째 스텝에서 +0.83점으로 정점을 찍는다. Parcae와 Looped-Qwen3는 결정론적 표현에서 시작해 두 공간 모두 첫 상태를 사실상 그대로 쓴다. 적응형 강도는 추가 출력 패스 비용 때문에 LoopCD-Logits에만 적용되고, LoopCD-Hidden은 고정 강도만 지원한다.