RLVR 학습 이득을 저차원 활성화 벡터로 재현하고 붕괴를 예측한다

Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors

HF Daily2609.34344

Yuchen Cai, Ding Cao, Qixiang Yin2026-09-28

무엇인가

RL은 LLM 후속 학습의 핵심이 됐지만, 파라미터 업데이트가 고차원이라 내부에서 실제로 무슨 일이 벌어지는지 분석하기 어렵다. 기존 연구는 샘플링 효율, 엔트로피 동역학, 스케일링, 업데이트 기하를 다뤘지만 "RL이 만든 행동 변화가 활성화 공간에서 어떤 구조를 갖는가, 그리고 그 구조가 능력 전이와 훈련 안정성에 어떻게 연결되는가"는 비어 있었다. 이 논문은 검증 가능한 보상 기반 강화학습(RLVR)을 활성화 공간의 개입 문제로 재정식화하고, 그 답을 두 개의 기하학적 성질로 정리한다.

어떻게 동작하나

방법의 핵심은 벡터 스티어링이다. 베이스 모델을 동결한 채 선택한 레이어의 출력에 입력·토큰 위치와 무관한 공유 벡터를 더한다(h'_ℓ = h_ℓ + δ_ℓ). 이 저차원 개입만 학습시켜 RL로 튜닝된 teacher 모델을 증류했을 때 RL 이득이 얼마나 복원되는지를 측정한다. 즉 "RL 이득이 저차원으로 기술 가능한가, 그리고 그 기술이 언제 깨지는가"를 직접 찔러보는 구조다.

무엇과 다른가

첫 번째 성질은 Effective Manifold Capacity다. on-policy 증류에서 LoRA와 전체 파라미터 학습은 비슷한 성능을 내는데, 레이어당 단일 스티어링 벡터만으로도 대부분 과제에서 RL 이득의 85% 이상이 회복됐다. off-policy 증류에서도 회복률은 비슷하게 높았다. 한계도 분명하다. teacher-student 분포 격차가 커지면 전체 파라미터 > LoRA > 벡터 스티어링 순으로 성능이 갈리고, RL로 학습되지 않은 teacher에서는 성능이 크게 떨어지며 일부 설정은 붕괴한다. 주입 깊이도 변수다. 고정 벡터 개입은 저·중간 레이어에서는 잘 작동하지만 출력 근처에서 나빠진다. 그래디언트 노름을 재보면 저층과 고층이 비슷한데도 최종 성능은 크게 벌어져, 최적화 신호 약화가 원인이 아님을 보인다. 대신 Rank-1 게이팅(δ_ℓ(h_ℓ)=B_ℓσ(A_ℓh_ℓ), B는 0으로 초기화)을 쓰면 네 개 고층 주입 지점 모두에서 teacher KL이 줄고 수렴 성능이 개선됐으며, 파라미터 수를 맞춘 입력 무관 대조군은 이 개선을 재현하지 못했다. 랭크를 16까지 올리면 전체 파라미터 참조에 근접한다. 토큰별 그래디언트 코사인 유사도는 저·중간층 약 0.019에서 출력 근처 약 0.14로 올라가고, 게이팅 계수는 저층에서 [0,1]에 넓게 퍼지다가 고층에서 0과 1 근처로 몰린다.

어떻게 쓰나

두 번째 성질은 Control Manifold Separation이다. 레이어마다 서로 직교하는 벡터를 순차적으로 학습시켜 보면, SciKnowEval에서 DeepSeek-R1-Distill-Qwen-1.5B 기준 첫 방향이 67.5%, 여덟 번째 방향 v^(7)이 62.0%로 5.5%p밖에 낮지 않다. 선행 방향을 배제해도 남은 직교 공간에 유효한 해가 충분하다는 뜻이다. 모델이 작을수록 순서에 따른 하락이 급하고, 큰 모델은 고차 방향을 더 잘 유지한다. teacher 파라미터화(전체 파인튜닝 vs LoRA 랭크)와 증류 방식(on/off-policy)을 바꿔도 같은 인덱스끼리의 정렬이 교차 인덱스보다 강했다. 과학을 물리·화학·재료·생물로 나눠 6개 순서쌍의 방향 정렬과 정규화 전이 이득을 비교하면 선형 적합 R²=0.91이 나온다. 위치도 특징적이다. 추출된 방향은 Top-10% 주성분 부분공간에 에너지의 1~2%만 넣는데, 이는 등방 기준 10%보다 훨씬 낮고 v^(0)부터 v^(8)까지 유지된다. 반대로 Top-30% 부분공간으로 제한하면 Top-10% 에너지가 약 15%로 올라가지만 정확도는 개선되지 않는다. 그리고 실제 RL 학습에서 주성분 침입도(PSI)는 안정 구간에서는 낮게 유지되다가, 눈에 보이는 점수 하락이 나타나기 전에 변동성이 커지고 붕괴가 진행되면 계속 상승한다.

전제와 한계

이 관찰을 그대로 도구로 만든 것이 Alpha-Stabler다. Predictor는 워밍업 50회 업데이트 동안 동결된 베이스 모델로 토큰 수준 활성화 공분산을 추정해 상위 고유벡터 U(히든 차원의 10%)를 뽑고 이후 고정한다. 레이어별 PSI와 이를 합산한 집계 PSI를 계산하고, 임계값은 레이어별 중앙값과 스케일된 중앙절대편차로 잡는다. 지수이동평균으로 스무딩한 PSI가 경고 임계값을 연속 p회 넘으면 제어를 켜고, 하위 임계값 아래로 내려가면 끈다. Controller는 순전파 활성화는 건드리지 않고 역전파 그래디언트에서 주성분 부분공간 성분만 제거하며(G̃ = G - a(GU)U^T) 직교 여공간 성분은 보존한다. 추가 학습 파라미터가 없고 옵티마이저·보상 함수·모델 구조를 바꾸지 않으며, 활성 훅마다 저랭크 행렬곱 두 번이 전부다.

실험은 DeepSeek-R1-Distill-Qwen-1.5B/7B와 Qwen3-4B/8B/14B 등 5개 LLM, 수학 추론·과학 추론·코드 생성·지시 따르기 4개 과제군(검증 가능 보상 과제 6개)에서 이뤄졌고 teacher는 GRPO 또는 DAPO로 학습했다. Alpha-Stabler는 2,000 스텝까지 학습을 안정화하고 RL 이득을 일관되게 개선했다. 절제 실험에서 안정화 효과는 테스트한 학습률 전반에서 유지됐고(비제어 학습은 결국 붕괴, 제어 학습은 최대 PSI가 한 자릿수 퍼센트), 트리거 방식 제어가 지연 제어보다 낫고 항상 켜둔 것과 동등했다. 부분공간 선택도 중요해서 Top-PC 투영이 무작위 부분공간·Middle-PC·Bottom-PC는 물론 전역 그래디언트 클리핑보다 우수했다. 같은 wall-clock 시간에서 점수 궤적이 거의 동일해 추가 시간 부담도 거의 없다. 다만 Alpha-Stabler의 최종 점수 절대값이나 기준선 대비 정확한 개선폭은 본문에 수치로 제시되지 않았다.

실무적으로 이 논문이 주는 것은 두 가지다. 하나는 RLVR 파이프라인에서 보상이 오르다 갑자기 무너지는 현상을 "주성분 부분공간 침입"이라는 단일 스칼라로 모니터링할 수 있다는 점이다. 점수 하락이 관측되기 전에 PSI가 먼저 흔들리므로 조기 경보로 쓸 수 있다. 다른 하나는 그래디언트 클리핑처럼 무차별적으로 누르는 대신 특정 부분공간 성분만 제거하는 개입이 더 낫다는 실험 근거다. 도입을 검토한다면 워밍업 50스텝과 베이스 모델 기준 통계가 전제라는 점, 유지할 부분공간 비율이 히든 차원의 10%로 고정돼 있다는 점, 임계값이 중앙값과 MAD 기반이라 태스크마다 재보정이 필요하다는 점을 확인해야 한다.

저자들이 밝힌 한계는 분명하다. 이론적 틀이 제1원리에서 유도된 것이 아니라 경험적으로 동기부여된 가정 위에 서 있다. 분석과 실험도 수학 추론·코드 생성 같은 RLVR 과제에 한정되며, RLHF나 멀티턴 에이전트 의사결정, 개방형 생성에서 같은 기하학이 성립하는지는 검증되지 않았다. 향후 과제로 뉴런 귀속과 인과 추적으로 가정을 완화하고, RLHF·에이전트 설정으로 확장하며, 여공간 정규화 항을 넣거나 PSI를 학습률·개입 강도의 적응 신호로 쓰는 방향을 제시한다.