다중 보상 강화학습에서 희소 보상의 활성 밀도로 가중치를 정하는 DARA

Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL

HF Daily2610.00574

Tong Zheng, Skylar Zhai, Zhan Cheng2026-09-30

무엇인가

다중 보상 강화학습은 LLM이 정답 생성, 길이·형식 제약 준수, 안전성, 도구 호출 같은 여러 행동 목표를 동시에 만족하도록 학습한다. GRPO 계열은 별도 가치 모델 없이 롤아웃 그룹 내 상대 비교로 어드밴티지를 추정하는데, 보상을 먼저 합산한 뒤 정규화하면 서로 다른 보상 조합이 같은 어드밴티지로 뭉개지는 문제가 생긴다. GDPO는 이를 피하려고 보상 차원마다 독립적으로 그룹 정규화한 뒤 합산한다. 그런데도 GDPO 논문 자체의 실험에서 목표별 학습 진도가 여전히 불균등하게 나타났고, 저자들은 이를 "모델이 더 쉬운 목표를 우선한다"는 현상으로만 설명한 채 소소한 가중치 조정으로는 이 우선순위가 잘 바뀌지 않는다고 보고했다. 이 논문은 그 뒤에 있는 최적화 메커니즘이 무엇인지, 그리고 가중치를 반복적인 경험적 튜닝이 아니라 그 메커니즘에서 유도할 수 있는지 묻는다.

어떻게 동작하나

핵심 분석 도구는 어드밴티지 에너지(advantage energy)다. 배치 전체에 대해 특정 보상의 제곱 어드밴티지를 합한 값 E_k로, 정책 업데이트를 실제로 밀어내는 신호의 양을 나타낸다. 저자들은 이상화된 GDPO 정규화 조건(ε=τ=0, 상수 보상 그룹에는 0 어드밴티지 부여, 표본 표준편차의 분모를 G-1로 사용)에서 활성 그룹 하나가 항상 G-1만큼의 에너지를 기여하므로 E_k = B·π_k·(G-1)이 성립함을 보인다. 여기서 π_k는 활성 그룹 밀도, 즉 해당 보상이 그룹 내 응답들 사이에 0이 아닌 상대 어드밴티지를 만들어낸 롤아웃 그룹의 비율이다. GDPO는 활성 그룹 하나의 기여도는 균등하게 맞추지만, 배치 전체로 누적되는 에너지는 밀도에 선형 비례한다는 것이 남는 불균형이다. 밀도가 왜 보상마다 크게 다른지도 설명된다. 성공 확률 p인 이진 보상에서 그룹이 활성일 확률은 1-p^G-(1-p)^G이고, 이는 그룹 크기 G가 커질수록 증가한다. 너무 어려운 보상은 전부 실패한 그룹만, 거의 포화된 보상은 전부 성공한 그룹만 만들어 밀도가 낮고, 중간 영역의 보상이 훨씬 자주 활성화된다.

무엇과 다른가

DARA(Density-Aware Reward Aggregation)는 이 관계에서 바로 유도된다. 보상 k에 채널 가중치 α_k를 곱하면 에너지는 α_k²E_k가 되므로, 배치 내 최대 밀도 π_ref에 맞춰 에너지를 등화하면 α_k* = sqrt(π_ref/π_k)가 나온다. 즉 드물게 활성화되는 보상이 유용한 비교를 제공할 때 더 큰 가중치를 받는다. 실제 구현에서는 w_max로 증폭을 상한 처리하고(식 6), 밀도가 0으로 측정된 보상에는 증폭을 주지 않는다. 이 가중치를 양·음 어드밴티지 모두에 적용하는 DARA-Sym이 에너지 등화의 직접 구현이지만, 보상 차원이 충돌할 때 음의 계수까지 함께 증폭되는 부작용이 있다. 그래서 주 방법으로는 같은 밀도 가중치를 양의 어드밴티지에만 추가 증폭하는 DARA-Asym(Ã = A + (w-1)[A]_+)을 쓴다. 절차는 매 롤아웃 배치마다 보상별 어드밴티지를 계산하고, 활성 그룹 밀도를 추정하고, 가중치를 구해 보정한 뒤 합산하고 배치 단위로 정규화하는 것이다. 정책 최적화 목적함수 자체는 GDPO와 동일한 클리핑 목적함수를 그대로 쓰며, 보상 집계 단계만 바꾼다.

어떻게 쓰나

도구 호출 실험은 ToolRL 데이터(학습 3,920개, 검증 80개)로 Qwen2.5-1.5B-Instruct와 3B-Instruct를 학습시켰다. 보상은 형식 준수를 검사하는 이진 보상 {0,1}과 도구 이름·파라미터 이름·값 일치에 [-3,3] 점수를 주는 정확도 보상 두 가지다. 비교 대상은 GRPO, GDPO, 그리고 동시기 방법인 DVAO와 GD²PO-Hard를 같은 설정으로 재구현한 것이다. 평가는 BFCL-v4의 Live, Non-Live, Multi-Turn 과제다. 형식 보상 중앙값이 0.8에 도달하는 스텝은 DARA 두 변형이 14~15스텝으로, GDPO 19스텝, GRPO 34스텝보다 빨랐다. 60스텝 시점에서 DARA-Sym과 DARA-Asym은 평균 정확도 50.94%, 50.69%와 평균 형식 96.06%, 96.02%를 기록했고, 베이스라인은 최대 50.50% 정확도와 90.11% 형식에 그쳤다. 100스텝 최종 체크포인트에서는 1.5B 모델에서 두 변형 모두 GRPO·GDPO보다 평균 정확도와 형식을 개선했고, 3B에서는 DARA-Sym이 최고 평균 형식을, DARA-Asym이 GDPO와 대등한 성능을 냈다. 그룹 크기 G를 4·8·16·32로 바꾼 실험(스텝당 2,048 응답 고정)에서도 G가 커질수록 형식 활성 밀도가 올라가고 0.8 도달이 빨라진다는 예측이 맞았다. 세 번째 보상으로 16단어 이하 사고 블록을 요구하는 길이 보상을 추가했을 때, GDPO는 평균 형식이 97.11%에서 94.39%로, Multi-Turn 형식이 91.40%에서 83.17%로 떨어졌지만 DARA-Asym은 97.90%→96.93%, DARA-Sym은 97.55%→97.43%로 간섭을 크게 피했다.

전제와 한계

수학 추론 실험은 DeepSeek-R1-1.5B, Qwen3-4B-Instruct, DeepSeek-R1-7B에서 DAPO 방식 학습, DeepScaleR-Preview 데이터, DeepSeek-R1 프롬프트 형식, 최대 8,000 토큰으로 진행했다. 보상은 정답 일치 여부 {0,1}와 4,000 토큰 이하 여부 {0,1} 두 가지이며, MATH-500, AIME 2024, AMC 2022/2023, Minerva, OlympiadBench로 평가했다. 길이 준수 99% 임계값에 안정적으로 도달한 스텝은 Qwen3-4B-Instruct에서 DARA-Asym 66, DARA-Sym 59, GDPO 111이었고, DeepSeek-R1-7B에서는 56, 50, 142로 GDPO 대비 41~65% 적은 스텝이다. 80% 같은 완만한 임계값에서는 세 방법 모두 20스텝으로 차이가 거의 없었고, 포화에 가까워질수록 격차가 벌어졌다. DeepSeek-R1-7B의 홀드아웃 평가에서 DARA 두 변형은 50스텝에 95% 길이 준수를 처음 달성한 반면 GDPO는 70스텝이었다. 50스텝 체크포인트에서 DARA-Sym이 세 모델 모두 최저 평균 초과율(5.18%, 1.69%, 1.09%)을 기록했고, DARA-Asym은 더 높은 정확도(45.83%, 60.30%, 58.31%)와 초과율 8.16%, 4.38%, 3.73%를 보였다. 두 DeepSeek-R1 모델에서 DARA-Asym이 비교 방법 중 최고 Joint 점수(45.14%, 57.83%)를 냈다. 고정 가중치 소거 실험(정확도 가중치 1, 길이 가중치 5)에서는 DARA-Asym의 초과율이 4.21%에서 3.14%로 낮아지는 대신 정확도가 48.03%에서 46.84%로 떨어졌고, DARA-Sym도 초과율은 0.89%→0.87%로 거의 그대로인데 정확도가 46.71%에서 45.97%로 하락했다. 희소 보상 가중치를 그냥 키우는 것과 밀도 기반 보정은 비용이 다르다는 뜻이다. 100스텝까지 늘린 실험에서는 Qwen3-4B-Instruct에서 DARA-Asym이 정확도 62.17% 대 GRPO 62.99%로 거의 대등하면서 초과율을 0.70%에서 0.25%로 낮췄고, Qwen3-4B-Thinking에서도 64.23% 대 64.82%, 초과율 1.86%→0.94%를 기록했다.

개발자 입장에서 이 방법의 매력은 추가 하이퍼파라미터 탐색 없이 배치마다 자동으로 가중치가 정해진다는 점이다. 정확도·형식·길이·안전처럼 활성화 빈도가 크게 다른 보상을 함께 학습시킬 때, 특히 어떤 목표가 거의 포화되어 학습 신호가 마르는 구간에서 효과가 커진다. 도입하려면 보상별 활성 그룹 밀도를 로깅해 어느 보상이 병목인지 먼저 확인하고, w_max 상한과 DARA-Sym/Asym 선택을 자기 태스크에서 비교해야 한다. 정확도-준수 트레이드오프가 다르므로 두 변형을 모두 돌려보는 것이 좋다. 구현은 GDPO의 보상 집계 단계만 바꾸면 되고 정책 최적화 목적함수는 건드리지 않으므로 기존 파이프라인에 얹기 쉽다.

저자들이 명시한 전제와 한계도 분명하다. 밀도-에너지 관계 E_k = B·π_k·(G-1)는 ε=τ=0, 상수 보상 그룹에 0 어드밴티지 부여, 표본 표준편차 분모 G-1이라는 이상화 가정에서만 성립한다. 정확한 에너지 등화 결과는 상한이 없는 DARA-Sym에만 적용되며, w_max 상한이 걸리면 등화가 근사에 그친다. 밀도가 0으로 측정된 보상은 증폭을 받지 못하고, 에너지가 정책 그래디언트 기여의 변동을 지배한다는 주장은 부록 A.3의 별도 공분산 조건 아래에서만 성립한다. DARA-Asym의 동기는 밀도 불균형에서 나오지만 그 변형 자체가 에너지 등화를 보장하지는 않는다는 점도 저자들이 구분해 둔다. 또한 최종 성능은 경쟁력 있는 수준을 유지하는 것이지 모든 지표에서 앞서는 것은 아니며, 어떤 방법이 앞서는지는 모델 스케일과 학습 단계에 따라 달라진다.