작은 LoRA 하나가 트랜스포머의 참조 추적 깊이를 수십 배로 늘린다

Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It

HF Daily2609.36585

Zehao Jin, Ruixuan Deng, Junran Wang2026-09-29

무엇인가

이 논문은 사전학습된 트랜스포머가 문맥 안에 주어진 참조 사슬(reference chain)을 얼마나 깊게 따라가는지를 문제 삼는다. K = apple, B = K, D = B, print(D) 같은 변수 대입 사슬에서 13개 표준 베이스 모델은 안정적으로 따라가는 길이가 1.4~3.6줄(중앙값 2.2줄)에 불과하다. Qwen3-8B는 3줄에서 선택 정확도 83.5%였지만 4줄에서 54%, 5줄에서 41.5%로 떨어지고, 64층과 32층인 OLMo-3-32B와 OLMo-3-7B가 모두 약 2.6줄에 머문다. 292B MoE인 DeepSeek-V4-Flash도 4.0줄이며 6줄 42%, 8줄 38%로 우연 수준(33%)에 가깝다. 루프를 더 돌려도 마찬가지여서 Ouro-1.4B의 3-체인 도달 길이는 1~5회 루프에서 0, 1.6, 2.3, 2.2, 2.2줄이었고, Huginn은 8·16·32회 재귀에서도 1.4~1.6줄이었다. 깊이를 늘리거나 반복해도 병목이 사라지지 않는다는 것이 출발점이다.

어떻게 동작하나

제안 방법은 특정 레이어 하나의 잔차 스트림 입력에 rank-8 LoRA를 적용하는 것이다. 수식은 h ← M(h) = s·h + B·A·h 로, A는 8×n, B는 n×8 행렬이고 s는 스칼라(바이어스 없음)다. 즉 전체 상태를 s배로 재조정하면서 rank-8 저랭크 업데이트를 더하는 형태로, ReFT 용어로는 표현 개입의 DiReFT 형태에 해당한다. 토큰마다 독립적으로 작동하고, 어텐션과 MLP를 포함한 나머지 가중치는 전부 동결된다. 학습되는 것은 A, B, s뿐이며 Qwen3-8B에서 65,537개(모델의 0.01% 미만), Ouro-1.4B에서 32,769개, Huginn에서 84,481개다. 학습 목표는 정답 크로스엔트로피에 WikiText-103 기준 KL(p0‖pM) 페널티를 더한 것이고, Qwen LoRA는 14번 레이어에 들어가 20줄까지, Ouro LoRA는 6번 레이어에 들어가 4회 루프로 학습된다. 같은 위치에서 어텐션/MLP 프로젝션 가중치를 갱신하는 projection LoRA나 FLAS 스타일 저랭크 플로도 유사하게 작동한다.

무엇과 다른가

표준 모델 결과는 극적이다. Qwen3-8B에서 14번 레이어 LoRA는 16·20·24줄 사슬에 대해 정확도 98.5%, 98.0%, 99.0%를 기록했고, 동결 모델은 각각 15.5%, 14.5%, 15.5%였다. 24줄 결과는 200문제 중 198개 정답(95% Wilson 구간 96.4~99.7%)이고 세 학습 시드가 별도 샘플에서 94.7~97.5%를 냈다. 더 오래 학습한 LoRA는 40줄 98%, 48줄 88%(동결 모델 4%, 9%)로 50줄에 도달한다. 다만 인터리브 순서에서는 24줄 정확도가 76.5%로, 3-체인에서는 16줄 정확도가 58.0%로 내려간다. Qwen3-8B의 14~22번 레이어를 재진입시키는 실험에서는 64줄 정확도가 1회 통과 34%에서 재진입 1회 66%, 2회 92%로 올랐고 동결 모델은 10%였다.

어떻게 쓰나

루프 모델에서는 LoRA가 반복 자체를 유용하게 만든다. Ouro-1.4B의 표준 LoRA는 1·2·3회 루프에서 1.9, 7.1, 17줄에 도달하고 4회 루프에서 24줄까지 전부 통과하며, 장기 학습 버전은 4회 루프 60줄, 6회 약 146줄, 8회 최소 160줄(160줄 정확도 87%)을 기록한다. Huginn의 장기 학습 LoRA는 8회 재귀 31줄, 16회 58줄이다. 메커니즘 분석에 따르면 LoRA는 중간 레이어의 짧은 구간에서 '릴레이'를 시작한다. 각 프로그램 줄이 자기 체인 정체성을 전달하며 어텐션이 점점 더 위쪽 줄까지 닿고, 동결된 헤드가 그 정보를 읽는다. Qwen에서 부모 줄 어텐션을 14~22번 레이어에서 제거하면 6·8·12줄 사슬이 우연 수준(53%, 48%, 55%)으로 돌아가지만, 릴레이 이후인 23~29번 레이어에서 같은 엣지를 제거하면 100%, 100%, 98%가 유지된다. Ouro에서는 두 줄 이상 위쪽 어텐션을 제거하면 도달 길이가 17.8에서 9.4로 줄어든다.

전제와 한계

개입 위치가 결정적이다. rank·데이터·최적화를 고정한 채 Qwen3-8B LoRA를 20번에서 21번 레이어로 옮기면 도달 길이가 20.5줄에서 5.2줄로 떨어진다. OLMo-3-7B는 12~15번, Llama-3.1-8B는 13~15번에서 같은 전환이 나타난다. 저자들은 동결 모델에서 3줄·3-체인 프로그램으로 '포인터 자체 토큰을 복원했을 때 효과의 절반 미만이 회복되는 첫 레이어'를 컷오프로 정의하고, 이를 사전 등록해 4개 홀드아웃 모델 중 3개(Llama-3.2-1B, Qwen3-4B, Gemma-3-12B)에서 기준을 맞췄다. OLMo-3-32B는 구간 중점에서 5레이어 빗나갔고, 평균 절대 오차는 2.25레이어로 깊이의 45% 규칙(3.45)이나 값 복사 레이어 −11.5(3.37)보다 낫지만, 9개 모델 전체에서는 2.22 대 2.27로 사실상 동률이다. MuSiQue에서는 정답만 지도해 학습한 LoRA가 Qwen3-8B, OLMo-3-7B, Llama-3.1-8B에서 각각 11.4, 9.4, 17.9 정확도 포인트를 더했고, Qwen의 동결 정확도 52.9% 대비 6번 레이어 LoRA가 30번 레이어 LoRA보다 13.0포인트 높았다. Ouro는 300개 개발 질문에서 48.3%에서 60.0%로 올랐다.

개발자 관점에서 이 논문이 주는 실무적 메시지는 두 가지다. 첫째, 다단계 참조·검색·체이닝이 필요한 작업에서 모델의 기본 정확도는 그 모델이 실제로 보유한 계산 능력의 하한일 수 있다. 전체 파인튜닝 없이 레이어 한 곳에 소수 파라미터를 붙이는 것만으로 큰 폭의 향상을 얻을 수 있다. 둘째, 그 개입의 효과는 위치에 극도로 민감하다. 중간 레이어의 유용한 계산이 개입 이후에도 이어질 수 있는 지점, 즉 모델별 컷오프 근처에 넣어야 하며, 컷오프 추정치는 정밀도가 높지 않으므로 국소 스윕이 필요하다. 또한 LoRA는 토큰 간 정보를 직접 교환하지 않으므로, 동결된 어텐션과 MLP가 통신을 담당한다는 점을 전제로 디버깅해야 한다.

저자들이 밝힌 한계도 분명하다. 메커니즘 실험은 합성·문맥 내 과제에 기반하고, MuSiQue는 골드 문단을 준 설정에서 위치 선호에 대한 증거를 제공할 뿐 동일 메커니즘의 직접 증거는 아니다. 상세 추적은 Qwen3-8B와 Ouro-1.4B에 집중되어 있고 루프 모델은 두 계열만 다룬다. LoRA는 과제 형식마다 따로 학습해야 하며, 텍스트 페널티는 측정된 통제일 뿐 일반적 행동 보장이 아니다. 위치 예측 정밀도는 보통 수준이고, 첫 루프만으로 충분하다는 결과는 약 25줄까지만 확인됐다. 가장 긴 체인의 루프 결과는 레벨 순서와 매 루프 LoRA 적용을 전제로 한다. 또한 학습된 라우팅 방향과 최소 충분 rank는 아직 규명되지 않았고, 인과 실험은 알고리즘을 유일하게 특정하지는 못한다.