BiasReducer가 보상 모델의 표면 편향을 재학습 없이 줄인다

BiasReducer: Adaptive Bias Mitigation for Reward Models

HF Daily2609.32720

Shuang Liu, Yongliang Miao, Yanguang Liu2026-09-26조회 5

무엇인가

보상 모델은 LLM 응답에 점수를 매겨 인간 선호로 훈련을 유도하지만, 정확성이나 유용성보다 길이·포맷·확신·아첨 같은 표면적 속성을 선호하는 경향이 있다. 길고 자신감 있는 응답이 더 틀렸는데도 높은 보상을 받으면, 응답 선택이나 정책 훈련에서 모델은 품질 대신 그 속성을 최적화하게 된다. 기존 대응은 두 갈래였다. 훈련 기반 방법은 데이터·손실·구조·미세조정 절차를 바꾸지만 재훈련 비용과 새 훈련 데이터가 필요하고, 모델 편집 방법은 재훈련을 피하는 대신 어떤 편향을 고칠지 미리 지정해야 하며 모든 데이터셋에 같은 고정 수정을 적용한다. 논문은 여기서 "재훈련도, 사전 지정도 없이 새 데이터셋마다 적합한 수정을 고를 수 있는가"를 문제로 세운다.

어떻게 동작하나

BiasReducer는 보상 모델의 선형 보상 헤드만 건드린다. 보상이 r(q,x)=w_r^T h(q,x)+b로 주어질 때 h를 포함한 나머지 파라미터는 모두 고정하고 w_r만 w_r'로 편집한다. 1단계는 어떤 내부 패턴이 어떤 응답 속성에 대응하는지 찾는 것이다. 선호 쌍 (x+, x-)의 은닉 표현 차이 Δh=h(x+)-h(x-)를 SAE 스타일 인코더-디코더에 넣어 z_pre=W_enc·u+b_enc를 만들고, 크기 기준 상위 k_act개만 남기는 TopK를 거쳐 û=V·z_post로 복원한다. 희소 분해만으로는 어느 좌표가 어느 속성인지 정해지지 않으므로, 미리 정의한 속성 a마다 좌표 z_a를 하나씩 배정하고 의미론적 감독을 건다. 자연스러운 속성 차이를 연결하는 행동 감독, 통제된 재작성으로 방향을 정하는 개입 감독, 재작성 전반에 공유되는 잡음을 흡수하는 아티팩트 항을 합쳐 L=L_rep+γ_b·L̃_beh+γ_i·L̃_int+γ_a·L̃_art로 학습한다.

무엇과 다른가

2단계는 각 속성에 대한 의존을 어떻게 줄일지, 즉 방향과 세기를 정한다. 속성 좌표 z_post,a와 은닉 상태의 공분산 C_a=Cov(h, z_post,a(h))를 구해 그 방향으로 보상 헤드를 w_a(λ)=w_r-λ·(w_r^T C_a/(C_a^T C_a+ε))·C_a 만큼 이동시킨다. 선형 개념 소거에서 착안한 식이다. 세기 λ_a*는 검증 세트에서 선호 정확도 하락을 정해진 예산 안에 묶으면서 보상 점수 변화를 가장 크게 만드는 값으로 고른다. 이렇게 (a, C_a, λ_a*)를 모은 편집 은행을 만든다. 3단계는 새 데이터셋에서 어떤 속성을 고칠지 정한다. 새 데이터의 응답·은닉 표현·원래 보상 점수는 쓸 수 있지만 어느 쪽이 선호 응답인지는 모른다는 전제다. 원래 보상이 속성과 얼마나 함께 변하는지 G_a(D)=|Cov(w_r^T h, z_pre,a(h))|와, 해당 편집이 점수를 얼마나 바꾸는지 I_a(D)=E|h^T w_a(λ_a*)-h^T w_r|를 각각 계산해 순위를 매기고, 두 순위의 합(Borda 방식)으로 우선순위를 정한다. BiasReducer-S는 최상위 하나를, BiasReducer-M은 최대 k_max개를 조합한다.

어떻게 쓰나

실험은 5개 보상 모델(Skywork-Reward-V2-Qwen3-1.7B, RM-Mistral-7B, GRM-Llama3.2-3B, internlm2-7b-reward, GRM-Llama3.1-8B)에서 수행했고, 속성 표현 학습과 편집 방향 결정에는 Skywork-Reward-Preference-80K-v0.2를 소스 데이터로 썼다. 평가는 RM-Bench-Hard, JudgeBiasBench, 그리고 Arena Human Preference 140K로 만든 스타일 충돌 테스트셋 Arena-StyleConflict에서 했다. 비교 대상은 원본 보상 모델과 두 훈련 기반 베이스라인(RRM 절차로 추가 미세조정한 것, 속성 개입 쌍을 소스 데이터와 섞어 미세조정한 것)이다. 쌍별 선호 정확도 기준으로 BiasReducer-S는 세 벤치마크에서 평균 6.2, 15.7, 6.0%p를, BiasReducer-M은 8.3, 18.0, 6.9%p를 올렸다. 평균적으로 더 강한 베이스라인인 RRM 대비로도 BiasReducer-M이 4.1, 13.2, 2.3%p를 추가로 얻는다. 하류 효과도 보고된다. Qwen3-4B와 Llama-3.2-3B-Instruct를 정책 모델로, Mistral-7B 보상 모델을 원본과 편집본으로 나눠 best-of-N 선택과 GRPO 훈련에 썼을 때, 불필요한 장황함과 아첨이 줄면서 Claude Sonnet 5가 평가한 응답 품질은 비슷한 수준을 유지했다.

전제와 한계

분석에서는 네 가지가 확인된다. 첫째, 의미론적 감독이 속성 정렬을 개선한다. 일반 SAE와 비교해 홀드아웃 속성 상관이 0.26에서 0.55로 올랐고, 행동 감독을 빼면 속성 축 상관이 0.55에서 0.17로, 개입 감독을 빼면 부호 정확도가 0.99에서 0.75로 떨어진다. 둘째, 편집 방향과 세기가 모두 중요하다. SAE 디코더 벡터를 방향으로 쓰면 세 벤치마크 이득이 0.5, 0.4, 0.6%p에 그친 반면 공분산 기반 방향은 6.2, 15.7, 6.0%p를 낸다. 속성별로 세기를 따로 정하면 Mistral-7B의 JudgeBiasBench 이득이 8.4에서 11.8%p로 늘어난다. 셋째, 데이터셋마다 유효한 편집이 달라 데이터셋별 선택이 고정 편집보다 낫고, 순위 합 규칙은 JudgeBiasBench에서 최적 편집을 86% 확률로 포함해 단일 신호(71~74%)를 앞선다. 응답 100개만 써도 전체 풀과 같은 선택을 89%, 200개면 97% 재현한다. 넷째, k_max를 2·3·4·6으로 바꿔도 차이는 크지 않지만 사전 크기와 활성 좌표 수는 벤치마크별로 상이한 영향을 준다.

개발자 관점에서 이 논문은 보상 모델을 이미 서빙 중이고 재훈련 예산이 없을 때 쓸 수 있는 편집 계층으로 읽힌다. 선형 보상 헤드를 가진 스칼라 보상 모델이라면 소스 선호 데이터로 속성별 편집을 한 번 학습해 두고, 새 평가·선호 데이터셋이 들어올 때 그 데이터의 보상 점수와 은닉 표현만으로 어떤 편집을 적용할지 고를 수 있다는 것이 핵심이다. 다만 새 데이터셋의 선호 라벨 없이도 선택이 된다는 전제, 속성 집합을 사람이 미리 정의해야 한다는 점, 그리고 편집 세기를 검증 세트의 정확도 하락 예산으로 정한다는 점은 실제 적용 전에 확인해야 할 조건이다.

저자들이 밝힌 전제와 한계도 분명하다. BiasReducer는 보상 모델의 모든 파라미터를 고정하고 선형 보상 헤드 w_r만 편집한다고 가정하므로, 보상 헤드가 선형이 아닌 구조에는 그대로 적용되지 않는다. 속성은 길이·확신·아첨처럼 미리 정의된 집합이며, 학습과 편집 강도 결정에는 소스 선호 데이터(훈련·검증 분할)가 필요하다. 새 데이터셋에서는 응답과 은닉 표현, 원래 보상 점수는 쓸 수 있지만 어느 응답이 선호되는지는 알 수 없다는 조건이 명시돼 있다. 또한 사전 크기와 활성 좌표 수의 효과는 벤치마크에 의존적이어서, 이 값들은 성능이 특정 편집 복잡도 설정에 의존하지 않는다는 결론과 별개로 튜닝 여지가 남는다.