프롬프트별 학습가치 다른 멀티모달 RL 후학습은 EPS로 저효율 프롬프트 재작성함

Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training

HF Daily2609.15051

Yuanhao Yue, Qianli Ma, Chengyu Wang2026-09-14조회 4

무엇인가

이 논문이 다루는 문제는 온라인 강화학습 기반 후학습에서 훈련 프롬프트를 균등하게 취급한다는 관행이다. 저자들은 프롬프트마다 현재 정책에 주는 학습 신호의 질이 크게 다르다고 지적한다. 어떤 프롬프트는 이미 포화되어 추가 그래디언트 정보가 거의 없고, 어떤 프롬프트는 너무 어려워 rollout이 일률적으로 낮은 보상만 내놓아 감독 신호가 약하거나 잡음이 된다. 그 사이에 정책이 부분적 능력을 보이는 프롬프트가 있고, 이때 성공·실패 궤적이 섞여 나오면서 유용한 credit assignment가 가능해진다. 저자들은 이 프롬프트 의존적 유용성 차이를 exploration potential이라 부른다. 멀티모달 LLM에서는 언어 복잡도와 시각 내용이 기하·공간·기호 추론 난이도에 함께 얽히기 때문에 이 문제가 더 두드러진다. 결정적으로 프롬프트 유용성은 정적이지 않다. 정책이 좋아지면 한때 유용하던 프롬프트는 포화되고, 다른 프롬프트는 나중에야 학습 가능해진다. 그래서 훈련 프롬프트 분포 자체가 최적화 문제의 일부가 된다.

어떻게 동작하나

핵심 도구는 Exploration Potential Score(EPS)다. KL 정규화 정책 개선 이론에서 유도한 rollout 기반 프롬프트 유용성 프록시로, 이상적 정의는 E(x) = E_{y~π*}[R(x,y)] - E_{y~πθ}[R(x,y)]다. 여기서 π*는 현재 정책 πθ를 기준 정책으로 삼아 정의한 KL 정규화 최적 정책이다. 즉 EPS는 현재 정책 대비 국소적으로 개선된 정책 사이의 소프트 개선 격차를 측정한다. 값이 크면 단기 개선 여지가 많고, 작으면 이미 포화됐거나 지금 단계에서는 너무 어려워 유용한 신호를 못 준다는 뜻이다. π*를 직접 알 수 없으므로 논문은 Proposition 2.2의 닫힌 형태에서 근사를 유도한다. N개의 rollout {(y_i, r_i)}가 있을 때 Ê(x) = Σ_i r_i · σ_i - r̄, 여기서 σ_i = softmax(r_1/β, …, r_N/β)_i이고 r̄는 그룹 평균 보상이다. softmax 가중 항은 높은 보상 rollout에 가중을 실어 국소 개선 정책의 기대 보상을 근사하고, r̄는 현재 정책의 기대 보상을 추정한다. β는 KL 정규화 계수이자 온도 역할을 한다. 중요한 실무적 성질은 GRPO가 이미 훈련 중에 rollout과 보상을 모으기 때문에 EPS 계산에 별도 rollout이나 보조 모델이 필요 없다는 점이다. 다만 유한 샘플에서는 미래 학습 진척의 보정된 측정치가 아니라 온라인 랭킹 신호로 해석해야 한다고 저자들은 못 박는다.

무엇과 다른가

프레임워크는 Score, Filter & Rewrite, Refresh의 3단계 루프로 동작한다. 먼저 샘플링된 각 프롬프트를 EPS로 점수화하고 임계값 τ로 P_keep과 P_rewrite로 나눈다. 기본값은 τ = 0인데, 이상적 EPS가 음수가 아니므로 음의 유한 샘플 추정치는 주로 샘플링 잡음이나 현재 어려운 프롬프트를 반영하기 때문이다. P_rewrite에 들어간 프롬프트는 버리지 않는다. 교사 모델 T가 원 프롬프트, 학생 rollout {y_i}, 보상 {r_i}, 그리고 Ê(x)를 진단 맥락으로 받아 스캐폴드 변형 x' = T(x, {y_i, r_i}, Ê(x))를 생성한다. 이 재작성은 원래 과제 의도를 보존하면서, 예컨대 누락된 제약을 명확히 하거나 과제를 중간 하위 목표로 분해하거나 잘못된 추론 방향을 바로잡는 방식으로 프롬프트를 더 학습 가능하게 만든다. 최종 답을 직접 노출하지는 않는다. 저자들이 강조하는 개념적 전환은 교사 감독을 출력 모방이 아니라 훈련 데이터 정제로 재정의한 것이다. 재작성된 프롬프트는 refresh 버퍼에 들어가 주기적으로 훈련 풀에 재투입되고, 저효율로 제거된 원본은 reserve set에 남겨 두었다가 정책이 발전해 추정 유틸리티가 τ를 넘으면 다시 활성화된다. 교사 질의는 별도 워커가 정책 최적화와 병렬로 처리하는 비동기 구조라 메인 RL 루프 처리량에 주는 영향은 제한적이지만, 교사 측 추론 비용은 실질적 고려 사항으로 남는다.

어떻게 쓰나

실험은 OmniThoughtV(필터링된 50만 개 멀티모달 추론 예시)로 지도 미세조정을 한 뒤, Geometry3K와 MMK12에서 GRPO 기반 RL 훈련을 수행하는 구성이다. 백본은 Qwen3-VL-2B와 Qwen3-VL-4B, 3,000 RL 스텝, 전역 배치 16, 8개 GPU FSDP, 최대 응답 길이 3,072 토큰, 프롬프트당 N=8 rollout, 학습률 1×10^-6, PPO 클리핑 0.2, 참조 정책 대비 KL 페널티 0.01을 쓴다. 보상은 MathRuler로 검증 가능한 보상 함수를 구성하고, 도메인 외 평가는 LMMs-Eval 프레임워크와 Qwen3-VL-Plus API 판정자를 사용한다. 비교 대상은 동일한 RL 설정에서 EPS 선택과 교사 스캐폴딩만 뺀 표준 GRPO다.

전제와 한계

결과는 두 훈련 데이터셋과 두 모델 크기 모두에서 GRPO를 일관되게 앞선다. MMK12로 훈련했을 때 평균 도메인 외 정확도는 2B 모델에서 39.50%에서 42.83%로, 4B 모델에서 50.87%에서 52.67%로 오른다. 가장 큰 개선은 어려운 도메인 외 벤치마크에서 나온다. MMK12 훈련 시 MathVision은 2B에서 28.62%에서 31.91%로, 4B에서 41.78%에서 44.41%로 향상되고, MMMU-Pro는 MMK12 훈련 2B 모델이 36.59%에서 40.64%로 오른다. 전체적으로 도메인 내 최대 9.7% 상대 개선, MathVision 11.5%, MMMU-Pro 11.1% 이득을 보고한다. 훈련 데이터 규모 효과도 관찰된다. 2B 모델의 평균 도메인 외 정확도는 Geometry3K 후학습에서 41.47%, MMK12 후학습에서 42.83%로, 더 크고 다양한 프롬프트 풀이 표적 재작성 기회를 더 많이 제공한다는 해석이다. 모델 규모 효과로는 2B와 4B 모두 개선되지만 상대 이득은 작은 모델에서 더 큰 경향이 있다. 더 강한 베이스 모델은 이미 많은 프롬프트를 유능하게 처리해 프롬프트 수준 정제로 얻을 여지가 적다는 설명이 붙는다. 다만 절대 성능은 4B가 모든 벤치마크에서 가장 높다.

EPS가 실제로 유용한 신호인지도 분석한다. MMK12 훈련 프롬프트를 추정 EPS로 묶어 처음 1,000 RL 스텝의 학습 거동을 비교한 결과, EPS ≥ 0.5 프롬프트만 훈련하면 44.85%, 0 < EPS < 0.5 구간만 훈련하면 39.55%로 나타났다. 동시에 EPS > 0 전체를 쓰면 46.00%로 고-EPS 전용보다 1.15포인트 더 좋았는데, 이는 프롬프트 유용성이 이분법이 아니며 중간 정도로 유용한 프롬프트가 다양성에 기여한다는 증거다. 반대로 EPS > 0 설정과 필터링 없는 풀을 비교하면 4.10포인트 격차가 나서, 0에 가까운 EPS 프롬프트가 훈련 효율을 떨어뜨린다는 것을 보여준다. 이것이 τ = 0을 자연스러운 필터 임계값으로 삼고 해당 프롬프트를 활성 풀에 남기는 대신 스캐폴딩 모듈로 보내는 근거다. 스캐폴드 프롬프트 갱신의 효과도 보고된다. 표준 GRPO와 비교해 스캐폴드 프롬프트로 훈련하면 최적화 전반에 걸쳐 advantage 추정치가 더 크고 일관되게 양수로 나오며, 첫 프롬프트 풀 갱신 이후 MMK12 검증 정확도가 눈에 띄게 상승해 남은 훈련 동안 GRPO 베이스라인 위에 머문다.

개발자 관점에서 이 논문이 쓸모 있는 지점은 검증 가능한 보상이 있는 RL 후학습 파이프라인이다. 특히 EPS가 추가 rollout이나 보조 모델 없이 GRPO가 이미 수집한 on-policy 통계만으로 계산된다는 점이 실무적으로 매력적이다. 프롬프트를 버리는 대신 재작성해 재투입하는 데이터 플라이휠 구조는 정적 데이터셋에서 한 번 선별하는 방식과 달리 정책 변화에 맞춰 훈련 분포를 계속 적응시킨다. 도입을 검토한다면 세 가지를 확인해야 한다. 첫째, 교사 모델 추론 비용이 비동기 워커로 숨겨지더라도 실제로 발생한다는 점이다. 둘째, 현재 구현의 스캐폴드 생성이 answer-aware라는 점, 즉 교사가 참조 답에 접근해 답과 일관된 힌트를 만들되 최종 답을 직접 노출하지 않도록 지시받는 구조라는 점이다. 셋째, 프롬프트 풀 관리(rewrite queue, refresh buffer, reserve set 재평가)가 파이프라인 복잡도를 늘린다는 점이다.

저자들이 명시한 한계는 분명하다. EPS는 미래 학습 가능성의 정확한 측정치가 아니라 rollout 기반 프록시이며, 유한 샘플 잡음에 노출되어 모든 프롬프트를 완벽히 랭킹하지 못할 수 있다. 또한 스캐폴드 생성이 answer-aware이므로 결과는 교사 보조(teacher-assisted) 훈련 설정에서 해석해야 하고, 완전히 답을 보지 않는 스캐폴딩은 향후 과제로 남긴다. 실험 범위도 검증 가능한 보상이 잘 맞는 멀티모달 수학·시각 추론에 한정되어 있어, 비검증 보상이나 더 넓은 과제 다양성으로의 확장은 검증되지 않았다. 윤리적 고려로는 교사 모델이 프롬프트를 재작성할 때 그 결과 훈련 분포가 교사의 선호·가정·편향을 반영할 수 있으며 이를 완전히 예측하기 어렵다는 점을 밝힌다.

관련 논문