이방성은 역할 분담이며 SphereGate는 채널 게이트로 추론을 높인다
Understanding and Exploiting Anisotropy in Post-Training
무엇인가
LLM 사후학습은 시연을 따라 배우는 SFT(전방 KL, mode-covering)와 보상으로 정답 확률을 밀어 올리는 RL(역방향 KL, mode-seeking)을 결합한다. 빈도 가중 우도 학습은 잔차 스트림의 소수 채널에 활성이 유난히 크게 몰리는 이방성(anisotropy)을 남기는데, 이는 오랫동안 결함으로 취급돼 왔고 사후학습과 어떻게 상호작용하는지는 정리된 바가 없었다. 이 논문은 그 이방성이 실제로 무엇을 하는지 먼저 규명하고, 그 구조를 학습에 역이용한다.
어떻게 동작하나
분석은 라벨 없이 이뤄진다. 캘리브레이션 패스에서 각 층·채널의 블록 이후 활성 절대평균을 구하고, 중앙값에 비편향 중앙값 절대편차의 6배를 더한 임계값을 넘는 좌표를 선택한다. Qwen2.5-1.5B 진단에서 이렇게 뽑힌 그룹은 사후 SFT 좌표의 약 5%에 불과하지만, 이들을 제거하면 WikiText-2 퍼플렉서티가 10.44에서 2.01×10^6으로 폭발한다. 개수만 맞춰 무작위로 뽑은 보완 채널을 제거했을 때의 35.06과 비교하면 차원이 다르다. 반면 정답 롤아웃과 오답 롤아웃의 부분공간을 정규화 프로베니우스 겹침으로 재보면, 이 그룹에서는 정답·오답이 거의 완전히 겹친다. 즉 이 채널들은 언어 모델링의 일관성 기반(coherence substrate)을 이루지만 추론의 정오를 가르지는 않는다. 같은 사전학습 체크포인트에서 갈라진 두 분기를 비교하면 SFT는 이 채널 구성원 자체를 크게 바꾸는 반면, GRPO는 이들을 거의 건드리지 않고 보완 채널 쪽에서 상대적 활성 변화가 더 크게 나타난다. 저자들은 이 분업 구조를 근거로, 추론 적응은 보완 채널에서 일어난다고 주장한다.
무엇과 다른가
제안 방법 SphereGate는 이 관찰을 그대로 학습 설계로 옮긴다. 각 디코더 블록이 어텐션과 MLP를 거쳐 잔차 스트림에 쓴 뒤의 전체 잔차 상태에 대해, 채널마다 양의 게인 하나를 곱한다. 게인은 exp(θ)로 매개화하고 θ는 0으로 초기화해 항등 연산에서 출발하며, 값은 c=0.7로 클램프된다. 학습되는 것은 이 θ뿐이고 백본 가중치는 전부 동결된다. 기본 설정에서는 모든 채널의 게인을 학습하지만, 분석용으로 일관성 채널과 보완 채널을 나눠 한쪽만 학습하는 제한 게이트 실험도 함께 한다. 총 학습 파라미터는 약 0.1M로, LoRA-XS·TinyLoRA·랜덤 서브네트워크 베이스라인과 예산을 맞춘다.
어떻게 쓰나
왜 이 방식이 일관성 채널을 망가뜨리지 않는지에 대한 근거도 제시된다. 게인에 대한 손실 기울기는 각 토큰 위치의 손실 민감도와 활성값의 곱을 합한 형태, 즉 활성 가중 기울기가 된다. 저자들은 롤아웃 배치에서 GRPO 보상 대리값과 KL 페널티로 이루어진 목적함수를 잡고, 채널별 기준 활성 에너지로 가중한 로그 게인 변위에 대해 곡률 가정(선택 블록의 양의 정부호성과 교차 블록 결합의 상한)을 두면, 선택 그룹의 변위가 (ε_C+τ_C)/λ + ρ‖z_R‖로 유계이고 채널별 이동량은 그 상한을 에너지의 제곱근으로 나눈 값 이하로 억제된다는 명제를 세운다. 에너지가 큰 채널일수록 같은 최적화 압력에서 덜 움직인다는 뜻으로, 이것이 이방성 채널 보존의 이론적 설명이 된다.
전제와 한계
실험은 Qwen2.5-Instruct 0.5B·1.5B·3B·7B, Llama-3-8B-Instruct, Qwen2.5-Math-7B에서 MATH-train, DAPO-Math-17k, MIX10k로 GRPO를 돌린다. PPO-clip ε=0.2, 내부 에폭 2, KL 계수 0.01, 90 스텝, 스텝당 프롬프트 64개×완성 8개(512 롤아웃), 온도 1.0, top-p 1.0, 1024 토큰 상한(수학 모델은 4096)을 쓴다. MATH-500 그리디 정확도에서 SphereGate는 모든 백본에서 최고치를 기록해, Qwen2.5-0.5B에서 42.3으로 가장 강한 PEFT 베이스라인 LoRA-XS의 35.0을 7.3점 앞섰고 7B에서는 격차가 2.5점이었다. 베이스 대비로는 Qwen2.5-3B가 64.5→70.0, Qwen2.5-7B가 70.0→79.5, Llama-3-8B-Instruct가 33.5→38.0이다. AMC23(Qwen2.5-7B)에서는 55.0%로 서브네트워크 53.7%, 베이스 51.9%를 앞섰고, Llama-3-8B의 Minerva Math에서는 베이스 대비 1.49점을 얻었다. Qwen2.5-7B-Math-Instruct에서는 AIME24 maj@16 23.33%(베이스 16.67%에서 6.66점 상승, LoRA-XS 20.00%)와 OlympiadBench 44.0%를 기록해 분포 밖 전이를 보였다. 채널 절제에서는 Qwen2.5-3B에서 보완 채널 게인만 학습해도 MATH-500 69.4로 전체 채널 게이트의 70.0에 0.6점 이내로 따라붙었다.
실무적으로 이 논문이 주는 시사점은 두 가지다. 첫째, 추론 RL을 돌릴 때 학습 예산을 가중치 공간이 아니라 표현 공간의 채널 단위로 배분하는 선택지가 생긴다. 0.1M 파라미터로 전체 모델 GRPO에 필적하거나 능가하는 결과를 냈다는 점은, 대형 모델을 여러 태스크로 분기시킬 때 백본을 그대로 두고 게인만 갈아끼우는 운용을 상정할 수 있게 한다. 둘째, 일관성 채널을 건드리지 않는 것이 성능의 핵심이라는 진단은, 기존 PEFT나 전체 미세조정이 왜 특정 구간에서 언어 능력을 훼손하는지 점검하는 지표로 쓸 수 있다. 다만 게인 클램프 값, 캘리브레이션 프롬프트 수, 어떤 층의 활성으로 채널을 뽑는지 같은 하이퍼파라미터가 결과를 좌우하므로, 자체 모델에 적용할 때는 채널 분할을 먼저 재현해 검증하는 편이 안전하다.
저자들이 명시한 한계도 분명하다. 이 발견은 기능이 배타적으로 국소화됐음을 증명하지 않는다. 실험에 쓰인 모델 크기가 서로 다르고, 제한 게이트 실험은 채널 그룹별 파라미터 수가 같지 않다. 개수를 맞추고 잔차 노름을 복원하는 통제를 했더라도 제거된 활성 에너지나 방향 변위까지 같아지지는 않는다. 또한 퍼플렉서티는 다음 토큰 예측을 재는 지표이지 의미적 일관성을 직접 재는 지표가 아니다. 이 논문의 주장은 어디까지나 일관성 대리의 운영적 지표로서의 이방성이며, 추론 채널과 일관성 채널의 구분이 모든 규모와 구조에서 그대로 성립한다고 단정하지는 않는다.