반사실 선호 피드백으로 보상 모델의 채점 근거를 학습하는 설명기 RewardExplainer

RewardExplainer: Learning Reward Model Explanations from Counterfactual Preference Feedback

arXiv2609.33989v1

Jingyi He2026-09-27조회 2

무엇인가

보상 모델(RM)은 LLM 후속 학습에서 강화학습 신호를 제공하는 핵심 부품이지만, 통상적인 판별형 RM은 프롬프트-응답 쌍을 하나의 스칼라 점수로 사상할 뿐이다. 점수를 비교하면 상대적 선호는 알 수 있어도, 어떤 응답 특성이나 행동이 그 점수 차이를 만들었는지는 알 수 없다. 기존 해석 기법은 사람이 미리 정의한 고수준 속성 집합에 의존해 응답을 그 축으로 교란하고, 새 예시마다 반복적으로 반사실 재작성과 재채점을 수행한다. 그 결과물은 해당 예시의 사후 설명으로 소비될 뿐, 한 번의 순전파로 고품질 설명을 내는 재사용 가능한 모델을 학습하는 신호로 전환되지 않는다. 게다가 해석에서 멈춰, 발견한 채점 메커니즘을 편향 탐지와 보상 모델 자체 개선으로 연결하는 폐루프도 없다. 논문은 이 세 가지 한계를 정면으로 겨냥한다.

어떻게 동작하나

제안하는 RewardExplainer는 타깃 보상 모델을 고정한 채 설명기만 학습하는 폐루프 프레임워크다. 먼저 SFT 워밍업 단계에서 타깃 RM이 채점한 K1개의 선호 쌍에 대해 교사 LLM(GPT-4o)이 만든 메커니즘 집합을 정답으로 감독 미세조정을 수행해, 원자적이고 일반화 가능하며 개입 가능한 텍스트 메커니즘을 생성하는 초기 능력을 부여한다. 다음으로 각 선호 쌍에서 높은 점수 응답 yH와 낮은 점수 응답 yL을 입력으로, SFT 초기 모델을 높은 temperature로 W=4회 샘플링하고 의미 중복을 제거해 후보 메커니즘 집합을 만든다. 각 후보 m은 양방향 반사실 검증을 거친다. 낮은 점수 응답에 m을 추가·강화해 점수 상승을, 높은 점수 응답에서 m을 제거·약화해 점수 하락을 기대하며, 무관한 내용은 최대한 보존한다. 두 방향 모두 기대한 점수 변화가 나오면 BOTH-success로 표시해 chosen 집합에 넣고, BOTH-success에 도달하지 못한 후보에서 같은 수만큼을 rejected 집합으로 골라 메커니즘 수준의 선호 쌍을 구성한다. 이 데이터로 DPO 목적함수를 최소화해, 타깃 RM의 관측된 채점 행동이 뒷받침하는 메커니즘 쪽으로 설명기를 이동시킨다. 핵심은 반사실 검증이 개별 설명의 평가 도구에 그치지 않고, 보지 못한 응답 쌍에 대해서도 충실한 메커니즘을 생성하도록 설명기를 훈련하는 감독 신호로 변환된다는 점이다.

무엇과 다른가

논문은 해석을 넘어 디바이어싱까지 연결한다. 최적화된 설명기로 선호 예시들에 대한 메커니즘을 대량 생성한 뒤, 실질적 응답 품질과 무관해 보이는 것들을 필터링·집계해 후보 편향 메커니즘 집합을 얻는다. 인간 선호 예시에서 선호 응답은 그대로 두고 비선호 응답에만 해당 편향 메커니즘을 최소 개입으로 주입해, 주입 성공과 선호 응답의 실질적 우위를 확인하는 필터를 통과한 디바이어싱 데이터셋을 만든다. 이 데이터로 원래 타깃 RM을 표준 Bradley-Terry 쌍별 목적함수로 파인튜닝하면, 비선호 응답이 표면적 단서를 갖추고 있어도 실질적으로 더 나은 응답에 대한 선호를 유지하도록 유도된다.

어떻게 쓰나

실험은 서로 다른 구조와 규모의 타깃 RM 세 개(FsfairX-LLaMA3-RM-v0.1, Skywork-Reward-V2-Qwen3-1.7B, RM-Mistral-7B)와 설명기 백본 세 개(Qwen3-4B, Qwen3-8B, Gemma4-12B)에서 수행됐다. 학습 데이터는 UltraFeedback을 주축으로 PreferenceHack과 Preference Model Perturbations를 더해 보상 해킹 패턴 커버리지를 넓혔고, 디바이어싱에는 Skywork Reward Preference 80K v0.2를 기반으로 재작성 데이터를 만들었다. 평가는 LLM 심사위원이 0~2점으로 매기는 메커니즘 품질(대조 선택성, 범위 보정, 방향 충실성), ADD/REMOVE/BOTH로 측정하는 반사실 충실성, 선호 예측 정확도 세 축이다. 학습에 쓰이지 않은 300개 응답 쌍에 대해 쌍당 3개 메커니즘을 생성해 비교했으며, FsfairX에서 Qwen3-4B 백본은 BOTH 성공률 48.44%로 GPT-4o의 35.57%를 앞섰고, 메커니즘 품질 종합 점수는 1.65로 GPT-4o 1.29, Contrastive Explanations 베이스라인 0.75를 크게 웃돌았다. SFT만 적용한 버전과 DPO까지 적용한 버전을 비교하면, 모든 타깃 RM과 백본 조합에서 DPO가 세 지표 모두 일관되게 향상시켰다.

전제와 한계

전역 선호 패턴 분석에서는 국소 설명들을 의미 중복 제거·클러스터링·추상화해 반복되는 채점 성향을 뽑아냈다. RM-Mistral-7B의 경우 사용자 과제에 더 직접적으로 집중하기, 해법을 단계로 정리하기처럼 실제 품질 향상과 정렬된 선호도 있었지만, 더 친절하고 사용자에게 맞춘 대화 스타일처럼 실질 품질과 덜 연결된 선호도 관찰됐고 이는 아첨(sycophancy) 같은 해킹 행동과 연관될 수 있다고 지적한다. 편향 탐지 실험에서는 RM-Mistral-7B가 채점한 50개 응답 쌍에서 6개의 대표적 잠재 보상 해킹 메커니즘을 확인했는데, 중복된 장황한 부연, 세련되거나 권위 있어 보이는 언어, 수치로 포장된 불확실성 표현 등이 여기 포함된다. 이런 메커니즘으로 만든 데이터로 파인튜닝한 결과 세 타깃 RM 모두 RewardHackBench와 JudgeBiasBench에서 성능이 올랐고 JudgeBench의 일반 평가 능력은 대체로 유지됐다. 동일한 양의 일반 선호 데이터로 파인튜닝한 General 베이스라인과 비교해도 두 벤치마크에서 일관되게 우세했으며, 이는 이득이 단순한 데이터 추가량 때문이 아니라는 근거로 제시된다.

개발자 관점에서 이 논문의 실용적 가치는 두 가지다. 첫째, 보상 모델을 블랙박스 채점기로 두고도 "왜 이 응답이 더 높은 점수를 받았는가"를 자연어 메커니즘으로 뽑아낼 수 있으며, 그 메커니즘이 실제 점수 변화를 유발하는지 양방향 개입으로 검증하는 절차가 그대로 재사용 가능한 파이프라인으로 제시된다. 둘째, 발견한 메커니즘을 비선호 응답에 역주입해 디바이어싱 데이터를 자동 생성하는 루프는, 자체 RM을 운영하며 보상 해킹 징후를 관찰한 팀이 곧바로 적용해볼 수 있는 형태다. 다만 도입 전에 확인할 것은, 반사실 재작성과 품질 평가에 GPT 계열 모델(GPT-5.4-mini, GPT-5-mini)과 LLM 심사위원이 개입하므로 API 비용과 심사 편향, 재현성이 파이프라인 품질을 좌우한다는 점, 그리고 BOTH-success 비율이 50%를 넘지 않아 상당수 후보가 버려진다는 점이다.

원문에는 별도의 한계(Limitations) 절이 제시되지 않았지만, 방법 서술에서 전제가 드러난다. 타깃 보상 모델은 학습 내내 고정되고 설명기만 별도로 최적화되며, 디바이어싱 데이터는 편향 메커니즘 주입에 성공했고 선호 응답이 실질적으로 더 우수하다는 필터를 통과한 표본만 사용한다. 즉 편향 메커니즘 목록과 재작성 품질, 필터 기준에 결과가 의존한다. 또한 메커니즘 품질은 LLM 심사위원 점수에 기반하므로 사람 평가와의 정합성은 원문에서 별도로 보고되지 않았다. 저자들은 결론에서 이 프레임워크가 언어적으로 그럴듯한 설명이 아니라 타깃 RM의 관측된 채점 행동을 더 충실히 반영하는 메커니즘을 학습하며, 그 메커니즘으로 보상 해킹에 대한 견고성을 높이면서 일반 평가 능력을 대체로 보존한다고 주장한다.