라벨 없이 10만 개 편향 파라미터만 학습해 추론을 끌어올리는 테스트타임 강화학습

Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces

arXiv2609.18587v1

Naveen Vakada2026-09-16조회 6

무엇인가

테스트타임 강화학습(TTRL)은 정답 라벨 없이 모델의 추론 능력을 끌어올리는 방법이지만, 기존 접근법은 모델 파라미터의 상당 부분을 최적화하기 때문에 테스트 시점 최적화 비용이 크다. 이 논문은 여기서 한 발 더 나아가 묻는다. 보상 신호와 최적화 공간을 둘 다 극단적으로 제한해도 효과적인 테스트타임 적응이 나타날 수 있는가. 저자들은 이 질문이 특히 멀티모달 추론에서 날카롭다고 본다. 라벨이 붙은 검증 가능 보상을 구하기가 가장 어려운 영역이기 때문이다. 기존 멀티모달 TTRL 연구는 자기 생성 보상을 쓰지만, 적응을 얼마나 작은 파라미터 부분공간으로 압축할 수 있는지는 다루지 않았다.

어떻게 동작하나

제안 방법의 이름은 label-free bias-only TTRL이다. 절차는 세 요소의 결합이다. 첫째, 각 문제 x_i에 대해 현재 정책에서 G개의 롤아웃을 샘플링하고(작업에 따라 G=32~64), 그 그룹의 다수결 답을 의사 라벨로 삼는다. 정답은 어디에도 쓰이지 않으며, 모델이 틀렸지만 자기 일관적인 그룹도 의사 라벨을 만든다. 둘째, 각 롤아웃을 의사 라벨과 비교해 정답이면 +1, 아니면 -1의 보상을 주고, GRPO로 그룹 정규화 어드밴티지 A_i^(g) = (r_i^(g) - mean) / (std + ε)를 계산해 롤아웃의 모든 토큰에 동일하게 적용한다. 셋째, 이 어드밴티지에서 나온 그래디언트를 편향 부분공간 φ에만 역전파한다. 구체적으로 각 대상 디코더 레이어 l의 MLP 출력에 상수 벡터 b_l을 더하는데, FFN_l(h_l) = W_down,l σ(W_up,l h_l) + b_l 형태이며 W_down, W_up과 어텐션·임베딩·정규화 가중치를 포함한 나머지 파라미터는 모두 사전학습 값으로 동결된다. 기본 설정은 28개 MLP 레이어 전체에 b_l을 두는 것으로, Qwen2.5-7B와 Qwen2.5-Math-7B에서 28 × 3584 = 100,352개의 파라미터만 학습한다. b_l은 학습 롤아웃 생성과 평가에서 동일하게 적용되는 하나의 고정된 산출물이며, AdamW와 bfloat16 정밀도로 200스텝 고정 예산만큼 학습한다. 곱셈이나 저랭크 업데이트 대신 단순 가산 오프셋을 쓴 이유는 레이어당 가장 작은 개입이면서 h_l과 무관하게 출력 분포를 상수 벡터만큼 이동시킨다는 기계적 해석이 가능하기 때문이고, 이는 비교 대상인 Sinii 등의 편향 전용 스티어링과 같은 메커니즘이다.

무엇과 다른가

저자들은 이 설계를 두 가지 이론적 주장으로 뒷받침한다. 명제 1은 의사 라벨 신뢰도에 관한 것으로, 정답 확률과 차선 답 확률의 차이인 마진 Δ(x)가 양수이면 다수결이 정답과 다를 확률이 (K-1)exp(-GΔ(x)²/2) 이하로, 롤아웃 수 G에 대해 지수적으로 감소한다고 예측한다. 정리 1은 제한 부분공간의 학습 가능성에 관한 것으로, 부분공간 S로의 직교 투영을 P_S라 할 때 도달 가능한 그래디언트 에너지 E_S = ||P_S g||²가 국소 개선량의 하한 J(w+) - J(w) ≥ (η/2)||P_S g||²를 결정한다고 말한다. 즉 보장되는 개선은 부분공간의 차원이 아니라 그 안에 담긴 유용한 그래디언트 성분의 크기에 좌우되며, 크기가 같은 부분공간이라도 똑같이 학습 가능하지는 않다.

어떻게 쓰나

실험은 텍스트, 비전언어, 오디오로 나뉜다. 텍스트는 Qwen2.5-7B와 Qwen2.5-Math-7B로 MATH-500(500문제, TTRL 패러다임에 따라 학습셋과 평가셋이 동일), 비전언어는 Qwen2.5-VL-7B-Instruct로 MathVista testmini, AI2D-TEST 전체 3088문제, LogicVista 448문제, 오디오는 Qwen2.5-Omni-7B로 MMAU-mini를 쓴다. 평가는 별도 언급이 없으면 그리디 디코딩, pass@1, 문제당 단일 생성이며 세 개의 독립 학습 시드에 대한 평균±표준편차로 보고한다. 결과적으로 같은 약 10만 파라미터 학습 절차가 여섯 벤치마크 모두에서 미학습 모델을 앞선다. MATH-500에서 Qwen2.5-Math-7B로 79.50%, Qwen2.5-7B로 76.67%를 기록했고, 비전언어 벤치마크에서 +3.8~+5.9점, 오디오에서 +3.5점을 얻었다. 파라미터화 효과를 분리하기 위한 LoRA 비교에서 편향 전용 TTRL은 q_proj 14개 레이어에 정확히 10만 파라미터를 학습하는 LoRA(r=1, exact-match)와 약 50배 많은 파라미터를 쓰는 LoRA(r=16)를 여섯 벤치마크 모두에서 앞섰고, LoRA(r=1)는 LogicVista에서 미학습 기준선(37.50%)보다 낮은 35.86%로 떨어졌다. LoRA(r=64)도 여섯 중 다섯에서 앞섰으며 AI2D에서만 뒤졌다. 전체 7.6B 파라미터를 학습하는 FullFT만이 여섯 중 다섯 벤치마크에서 편향 전용을 넘었고, MathVista에서는 편향 전용이 FullFT까지 포함해 전체 최고였다. 학습 없는 추론 시점 다수결 투표인 self-consistency 기준선도 비교했는데, Qwen2.5-Math-7B의 MATH-500에서 65.53%±1.27를 얻어 이득의 상당 부분이 투표만으로 나옴을 보여주지만, 편향 전용 TTRL은 모든 벤치마크에서 이 기준선을 다시 앞선다.

전제와 한계

라벨 출처와 학습 파라미터화를 교차한 2×2 절제도 MATH-500에서 수행했다. Qwen2.5-7B에서는 의사 라벨 편향 전용이 76.67%±1.57로 라벨 편향 전용(75.47%±1.21)을 1.2점 앞선 반면, 전체 미세조정은 반대 양상을 보여 라벨 전체 미세조정(87.93%±0.99)이 의사 라벨 전체 미세조정(77.00%±0.53)을 10.9점 앞섰다. Qwen2.5-Math-7B에서도 의사 라벨 편향 전용(79.50%±0.70)이 라벨 편향 전용(77.27%±0.70)을 2.2점 앞섰고, 라벨 전체 미세조정(85.13%±1.33)과 의사 라벨 전체 미세조정(83.80%±0.28)의 차이는 1.3점에 그쳤다. 저자들은 이 비대칭을 Qwen2.5-Math-7B의 다수결 의사 라벨이 수학 문제에서 이미 정답에 가깝고 Qwen2.5-7B의 의사 라벨은 더 잡음이 많다는 점으로 해석한다. 학습 연산량 차이도 크다. 편향 전용 학습은 GH200 한 장으로 실행당 4.45~4.95 GPU-시간이 걸리는 반면, 전체 미세조정은 FSDP 아래 GH200 네 장으로 79.24~82.12 GPU-시간이 필요해 GPU-시간 기준 16.0~18.5배 차이가 난다. 일반화 검증도 있다. 200스텝 체크포인트를 동결한 채 테스트타임 최적화에 쓰이지 않은 검증 분리 MATH 문제 4,500개로 평가했을 때, Qwen2.5-7B는 46.3%에서 70.9%로 24.6점, Qwen2.5-Math-7B는 52.5%에서 75.4%로 22.9점 올랐다.

왜 이런 제한 적응이 통하는지에 대한 진단도 제시된다. 명제 1의 예측을 확인하기 위해 MATH-500 문제 64개 배치에서 G_max=64 롤아웃을 한 번 생성하고 각 G에 대한 접두 다수결을 계산했는데, 의사 라벨 정확도의 순위가 롤아웃 수와 합의 강도(합의 프록시 m=(N1-N2)/64)를 함께 따라갔다. 정리 1의 예측은 단일 레이어 편향 부분공간 9개(각 3,584 파라미터)를 이른 층, 중간 층, 늦은 층에 걸쳐 학습시켜 검증했는데, 고정된 16문제 배치에 대한 공유 역전파에서 계산한 도달 가능한 그래디언트 에너지와 최종 스텝 정확도 사이의 스피어만 상관이 ρ=0.917(양측 순열 검정 p=0.0013)로 나타났다. 파라미터 수가 같다고 학습 가능성까지 같은 것은 아니라는 것이다.

멀티모달 개선에 대해서는 교란 요인 감사를 별도로 수행한다. AI2D에서는 학습이 공식 파서의 추출 실패율을 크게 낮춰, 개선의 일부가 답 내용 변화가 아니라 출력 형식 준수에서 온다는 것을 보여준다. MathVista에서는 스티어링된 모델이 일부 나이 차이 문제에서 같은 답을 반복 생성하는 좁은 예외 사례가 발견됐고, MMAU에서는 음소 세기 질문 템플릿이 관찰된 개선의 상당 부분을 차지하지만 그 템플릿을 제외한 나머지 문제에서도 양의 개선이 남았다. LogicVista에서는 기준선과 스티어링 모델에 동일한 사고사슬 프롬프트와 채점 절차를 적용해 프롬프트나 파싱 차이가 개입 효과로 오귀속되지 않게 했다. 저자들은 어떤 단일 지배적 교란도 찾지 못했다고 결론내리면서도, 라벨 없는 보상이 학습된 행동에 영향을 줄 수 있는 좁은 작업별 사례들을 명시적으로 보고한다. 윤리 성명에서도 이 방법이 검증된 라벨이 아니라 모델 자체 출력에서 나온 보상으로 적응하므로 원칙적으로 기존 오류를 교정하기보다 강화할 수 있다고 밝히고, 이런 효과에 대한 감사를 라벨 없는 테스트타임 적응 배포의 필수 요소로 본다.

개발자 관점에서 이 논문의 실질적 메시지는 두 가지다. 첫째, 라벨도 전체 파라미터 업데이트도 없이 약 10만 개의 가산 편향 벡터만으로 텍스트·비전언어·오디오 추론을 모두 개선할 수 있으며, 작업별로 바꿔야 하는 것은 프롬프트와 보상·채점 함수뿐이다. 둘째, 같은 10만 파라미터 예산이라면 무엇을 학습하느냐가 얼마나 많이 학습하느냐보다 중요하다. 파라미터 수를 맞춘 LoRA가 여섯 벤치마크 모두에서 편향 전용에 뒤졌고 LogicVista에서는 기준선 아래로 떨어졌다는 점, 그리고 도달 가능한 그래디언트 에너지가 어느 레이어가 학습 가능한지를 예측한다는 점은 적응 대상을 고를 때 참고할 진단 지표가 된다. 다만 자기 일관성만으로 만든 보상은 모델이 틀린 답에 일관되게 수렴할 때 그 오류를 굳힐 수 있고, 평가셋 자체를 학습에 쓰는 TTRL 패러다임 때문에 벤치마크별 교란(파서 형식 준수, 특정 질문 템플릿)을 별도로 감사해야 한다는 것이 저자들이 밝힌 전제다. 논문은 모든 자체 결과를 200스텝 고정 예산, 세 시드 평균±표준편차로 보고하며, 보상 셰이핑·스케일·파라미터화 안정성 절제와 전체 설정은 부록에 정리되어 있다.