다중 보상 GRPO의 정규화를 상관계수로 바꿔 큰 보상 독점을 막는다
CorrGRPO: Correlation-Normalized GRPO for Multi-Reward Learning
무엇인가
GRPO는 같은 프롬프트에서 샘플링한 롤아웃 그룹 안에서 보상을 중심화하고 그룹 표준편차로 나눠 어드밴티지를 계산한다. 보상이 여러 개면 각 구성요소를 합산한 총 보상을 그룹 표준편차로 정규화하는데, 합의 분산은 모든 쌍별 공분산의 합과 같다. 이 논문은 이 항등식에서 출발해 GRPO의 분모가 사실상 보상 공분산 행렬 전체를 반영한다는 점을 지적한다. 중심화된 총 보상이 고정되어 있을 때 공분산 합이 커지면 어드밴티지 크기는 작아지고, 작아지면 커진다. 즉 GRPO는 보상들 사이의 의존 관계에 따라 학습 신호의 세기를 암묵적으로 조절하고 있다.
어떻게 동작하나
문제는 공분산이 Cov(R_l, R_m) = σ_l σ_m ρ_lm 형태라서 통계적 의존성과 보상 스케일이 뒤섞인다는 점이다. 분산이 큰 보상 구성요소는 대각항과 비대각항을 모두 지배해 정규화의 민감도를 독점하고, 스케일이 작은 보상은 상관이 아무리 강해도 분모에 거의 영향을 주지 못한다. 논문의 예시(Figure 2)에서는 보상 3개와 궤적 4개를 놓고 보면 첫 두 보상의 상관이 0.9756으로 매우 강하고 세 번째 보상은 둘 다와 0.1098로 약한데도, 세 번째 보상의 분산 14.1696이 공분산 합 15.5520의 약 91.1%를 차지한다. 강하게 상관된 첫 두 보상 사이의 공분산 0.1707보다, 약하게 상관된 세 번째 보상의 공분산 0.1728이 오히려 더 크다.
무엇과 다른가
CorrGRPO는 이 스케일 불균형을 없애기 위해 분모의 공분산 항을 표본 피어슨 상관계수로 교체한다. 분자는 중심화된 총 보상 합을 그대로 두기 때문에 학습 목적이 지정한 보상 간 상대 가중치는 보존된다. 분모만 상관 행렬의 합으로 바뀌므로, 분산이 0이 아닌 각 보상은 대각에 1씩 동등하게 기여하고 비대각항은 의존성의 강도와 방향을 나타낸다. 분산이 0인 보상 구성요소는 해당 행과 열을 대각 포함해 0으로 설정하며, 이렇게 만든 행렬은 양의 준정부호성을 유지해 상관 합이 음수가 되지 않고 ε>0일 때 분모가 양수로 유지된다고 저자들은 부록에서 유도한다. 같은 Figure 2 예시에서 CorrGRPO는 강하게 상관된 두 보상에 0.9756을, 약한 관계에 0.1098씩을 배정해 강한 상관이 분모 합에 약 8.89배 더 기여하게 만든다.
어떻게 쓰나
코드 생성 실험은 Qwen2.5-Coder-Instruct 0.5B·1.5B·3B·7B를 LeetCodeDataset 학습 분할 2,641문제로 훈련하고 228문제 테스트 분할에서 평가했으며, HumanEval·MBPP·LiveCodeBench v6로 일반화도 확인했다. 보상은 포맷·문법·컴파일·실행·전체 테스트 통과·AST 유사도·효율성 7개를 가중 합산한다. GRPO 및 GDPO와 비교해 CorrGRPO가 모든 스케일에서 LeetCodeDataset Pass@1과 평균 벤치마크 Pass@1이 가장 높았고, GRPO 대비 평균 Pass@1이 0.5B에서 2.09, 1.5B에서 0.80, 3B에서 2.27, 7B에서 4.21 퍼센트포인트 올랐다. 7B 모델은 Pass@1 24.12%, 0.5B 모델은 Efficiency 67.86%, 3B 모델은 Pass@1 14.47%와 Efficiency 60.00%를 기록하며 정확도-효율 파레토 프론티어를 바깥으로 넓혔다.
전제와 한계
도구 호출에서는 Qwen2.5-7B-Instruct, Qwen3-4B-Thinking-2507, Qwen3-8B를 RLLA-4K(학습 3,920·테스트 80)로 훈련하고 API-Bank로 전이를 평가했다. RLLA-4K all-exact 점수는 GRPO 대비 63.38%→67.61%, 57.75%→59.15%, 61.97%→63.38%로 올랐고, API-Bank 평균은 각각 1.14, 3.94, 2.26 퍼센트포인트 개선됐다. 가장 큰 향상은 Qwen3-4B-Thinking의 API-Bank v3로 52.24%→64.08%였다. 에이전트 유틸리티 대 보안 실험에서는 AgentDojo로 훈련하고 ASB와 InjecAgent로 평가했는데, ASB Joint Accuracy가 14.88%→18.13%(Qwen2.5-3B), 31.38%→47.88%(Qwen2.5-7B), 57.38%→58.63%(Qwen3-8B)로 올랐고, InjecAgent 공격 성공률은 8.80%→5.52%, 13.53%→6.17%, 13.94%→7.98%로 낮아졌으며, AgentDojo Joint Accuracy는 3B에서 60.13%→89.62%로 가장 크게 개선됐다.
실무적으로 이 논문이 주는 시사점은 보상 함수를 새로 설계하지 않고도 어드밴티지 정규화 방식만 바꿔 다중 보상 학습의 균형을 개선할 수 있다는 것이다. 특히 보상 구성요소들의 수치 범위나 그룹 내 변동성이 크게 다른 경우(예: 이진 통과 보상과 연속 효율 보상의 혼합), 그리고 보상 간 트레이드오프가 있는 안전-유틸리티 설정에서 검토할 만하다. 다만 CorrGRPO는 분모만 바꾸고 분자의 상대 가중치는 그대로 두므로, 보상 가중치 자체가 잘못 설정된 문제는 해결하지 못한다는 점을 함께 봐야 한다.
저자들이 명시한 한계도 분명하다. 상관 기반 정규화는 편향되거나 잘못 정의된 보상을 교정하지 못하며, 최종 동작은 선택한 목적함수와 그 가중치에 계속 의존한다. 보안 실험은 벤치마크 프롬프트 인젝션에 대한 저항만 측정한 것이므로 이 벤치마크에서의 개선이 실제 배포 환경이나 보지 못한 공격에 대한 안전성을 보장하지 않는다고 밝힌다. 따라서 배포에는 애플리케이션별 안전 평가, 도구 접근 제한, 사람의 감독이 필요하다고 강조한다.