EAPO가 성공과 실패에 엔트로피를 비대칭으로 적용해 LLM 탐색을 넓힌다

Surprising Success, Repeated Failure: Entropy-Guided Credit Assignment for Exploration in LLM Reasoning

HF Daily2609.33781

Woongyeong Yeo, Minki Kang, Chanuk Lee2026-09-27조회 3

무엇인가

검증 가능한 보상 기반 강화학습(RLVR)은 결과 수준의 피드백만으로 LLM의 추론 능력을 끌어올리지만, 응답 안의 어떤 결정이 최종 결과에 얼마나 기여했는지는 구분하지 못한다. 이를 세분화하려는 기존 시도들은 보조 모델, 추가 샘플링, 또는 특권 정보를 요구했다. 정책 엔트로피는 롤아웃 정책에서 바로 얻을 수 있는 신호라 대안이 되지만, 기존 엔트로피 기반 방법들은 성공과 실패에서 불확실성을 똑같이 취급한다. 강화와 페널티 양쪽에서 고엔트로피 위치를 우선하면, 실패 응답 안에서도 대안 경로가 남아 있는 불확실한 위치에 페널티가 집중되어 탐색 기회 자체가 억눌린다. 논문은 여기서 "불확실성은 강화와 페널티에서 같은 방식으로 작동해야 하는가"라는 질문을 던진다.

어떻게 동작하나

저자들은 먼저 이 비대칭성을 실측으로 확인한다. Qwen3-4B/8B-Base에서 모델당 중간 난이도 수학 문제 20개를 골라 정답 2개와 오답 2개를 뽑고, 각 응답 안에서 평균 토큰 엔트로피가 높은 구간과 낮은 구간의 32토큰 윈도우를 상대 위치를 맞춰 비교했다. 고정된 프리픽스에서 64개의 연속 생성을 샘플링한 결과, 원래 정답이던 응답은 고엔트로피 윈도우에서 재샘플링하면 저엔트로피 윈도우보다 다시 성공할 확률이 크게 낮았다. 즉 불확실성 속의 성공은 반복되지 않는 "놀라운 성공"이다. 반대로 원래 오답이던 응답은 저엔트로피 윈도우에서 재샘플링해도 계속 틀리는 경향이 있었고, 같은 오답의 고엔트로피 윈도우에서는 정확도가 더 높았다. 고엔트로피 윈도우는 두 경우 모두 생성 간 중복도가 낮았다. 2,376개 Qwen3-4B-Base 응답의 단어 빈도 분석에서도 정답의 고엔트로피 위치에는 "let's", "consider" 같은 탐색 표현이, 오답의 저엔트로피 위치에는 "finally", "confirm" 같은 결론 표지가 몰렸다. 오답의 고엔트로피 위치에는 "try", "instead" 같은 탐색 표현이 남아 있었다.

무엇과 다른가

이 관찰을 토큰 수준 기여도 배분으로 옮긴 것이 EAPO(Entropic Advantage Policy Optimization)다. 먼저 토큰 엔트로피를 롤아웃 배치 전체의 10·90 퍼센타일로 정규화하고 0과 1 사이로 클리핑한 뒤 stopgrad를 걸어, 재가중 계수로는 쓰되 그래디언트는 흐르지 않게 한다. 다음으로 정규화된 엔트로피 h에 어드밴티지 부호 sign(Â)를 곱한 값을 지수화해 가중치 w를 만든다. w = exp(κ·sign(Â)·h)를 응답 내 평균으로 나눈 형태이며, 토큰별 어드밴티지는 Â에 이 w를 곱해 얻는다. 결과적으로 어드밴티지가 양수면 고엔트로피 결정에, 음수면 저엔트로피 결정에 더 큰 가중이 실린다. 응답 내 두 가중치의 비율은 e^κ로 제한되고, 평균으로 나누기 때문에 응답 전체의 크기를 바꾸지 않고 토큰 사이에 재분배만 한다. 이 토큰 어드밴티지를 기존 정책 목적함수의 응답 수준 어드밴티지 자리에 대입하면 끝이라, 보조 모델도 토큰 수준 지도도 추가 연산도 필요 없다. 저자들은 이 배분이 균등 배분을 기준으로 한 KL 앵커링 문제의 해와 일치함을 보이고(명제 1), 음수 업데이트가 선택되지 않은 대안 분포를 뾰족하게 만든다는 점(명제 2)을 들어 불확실한 위치의 페널티를 줄이는 근거로 삼는다.

어떻게 쓰나

실험은 AIME24/25/26, HMMT26, AMC23, MATH500 레벨5 부분집합 등 6개 경시 수준 수학 벤치마크에서 avg@32와 pass@32로 이뤄졌다. 베이스 백본은 Qwen3-4B-Base와 Qwen3-8B-Base, 추론 백본은 Qwen3-4B와 Olmo-3-7B-Think-DPO이며, DAPO-Math-17k-Processed로 DAPO 스타일 설정에서 학습했다. 비교 대상은 GRPO, EntropyAdv, HAPO, 80/20(Forking Tokens), RLRT다. EAPO는 네 백본 모두에서 평균 avg@32와 pass@32 최고치를 기록했다. Qwen3-4B-Base에서 평균 정확도 31.0%, Qwen3-8B-Base에서 34.0%로, 각각 가장 강한 엔트로피 기반 베이스라인(EntropyAdv, 80/20)을 5.6%포인트와 4.3%포인트 앞섰다. 특권 정보를 쓰는 RLRT보다도 두 베이스 백본 모두에서 앞선다. 추론 백본에서도 Qwen3-4B 72.4%, Olmo-3-7B-Think-DPO 74.3%로 각각 최강 베이스라인을 넘었다. 수학 외 일반화는 Reasoning Gym의 논리·공간·알고리즘 8개 과제에서 매크로 평균 34.89%(4B-Base)와 43.02%(8B-Base)로, 최고 베이스라인 대비 1.46%포인트와 3.02%포인트 개선됐다.

전제와 한계

탐색 효과를 직접 확인한 분석도 있다. AIME26에서 Qwen3-4B-Base로 샘플링 예산을 1에서 256까지 늘려가며 측정한 pass@k에서 EAPO가 모든 예산 구간에서 최고였고, k=256에서는 다른 어떤 베이스라인도 풀지 못한 문제를 추가로 풀었다. 초기 모델 기준 avg@32가 25% 이하인 어려운 문제들에서 최종 답안 다양성을 재면 EAPO는 정규화 답안 엔트로피가 더 높고 충돌률은 더 낮았다. "wait" 같은 탐색 표지 토큰의 1,000토큰당 빈도도 6개 벤치마크 전부에서 큰 차이로 가장 높았다. 절제 실험에서는 양수·음수 어드밴티지 각각에 대해 저엔트로피 선호·균등·고엔트로피 선호를 조합한 9가지 중 (b+, b-) = (+1, -1), 즉 EAPO의 조합이 avg@32와 pass@32 모두 최고였고, 균등 배분(GRPO에 해당) 대비 avg@32를 6.52%포인트 올렸다. 고엔트로피 강화를 고정하고 페널티 방향만 고엔트로피에서 저엔트로피로 바꾸면 정확도가 5.64%포인트 개선됐다. 하이퍼파라미터는 κ 하나뿐이며 기본값은 log 4다. κ가 커지면 학습이 빨라지지만 불안정해지고, κ가 0에 가까워지면 균등 배분으로 수렴한다.

개발자 관점에서 이 방법의 실질적 매력은 통합 비용이 낮다는 점이다. GRPO나 DAPO 계열 학습 루프에서 응답 단위 어드밴티지를 토큰에 뿌리는 부분만 정책 엔트로피 기반 가중치로 바꾸면 되고, 별도 보상 모델이나 프로세스 리워드, 교사 모델이 필요 없다. 다만 학습 로그에서 응답 길이와 평균 엔트로피를 함께 봐야 한다. EAPO는 학습 후반에 GRPO보다는 엔트로피가 높지만 EntropyAdv나 HAPO보다는 낮게 끝나며, 저자들은 평균 엔트로피 자체가 높은 것이 더 나은 탐색의 전제조건은 아니라고 정리한다. 또한 응답이 길어진 것만으로 성능이 오르는지 의심된다면, 베이스라인 응답을 같은 평균 길이까지 늘려 비교한 절에서도 격차가 닫히지 않았다는 점을 참고할 수 있다. κ 값은 안정성과 성능의 트레이드오프이므로 자체 모델에서는 log 4를 출발점으로 삼되 학습 안정성을 함께 모니터링하는 편이 좋다.

저자들이 밝힌 한계는 명확하다. EAPO는 정책 자체의 엔트로피를 신호로 쓰기 때문에 그 신호가 모델이 학습한 선호와 확신을 반영한다. 따라서 엔트로피 기반 기여도 배분의 신뢰성은 모델의 불확실성이 개별 추론 결정의 실제 기여도와 얼마나 정렬되는지에 달려 있다. 또한 분석은 주어진 추론 상태에서의 대안 연속 생성에 초점을 맞췄고, 서로 다른 상태나 궤적의 발견을 조합하는 문제는 다루지 않았다. 저자들은 다양한 후보 해를 유지하고 유용한 구성 요소를 재사용·결합하는 반복적 발견 설정으로 탐색을 확장하는 것을 향후 과제로 남긴다.