루브릭을 중간 표현으로 넣어 비디오 보상 모델의 스칼라 드리프트를 잡는 RewardVerse

RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

HF Daily2609.22947

Zhenchen Tang, Yang Li, Songlin Yang2026-09-19조회 12

무엇인가

비디오 생성 모델을 RL로 정렬할 때 보상 모델(RM)은 사실상 학습 신호의 전부다. 그런데 기존 비디오 RM들은 복잡하고 주관적인 비디오 품질을 명시적 평가 기준 없이 단일 스칼라 점수로 바로 매핑한다. 이 논문은 그 결과 생기는 scalar drift를 문제로 지목한다. scalar drift는 두 가지가 겹친 현상이다. 하나는 score-range collapse로, 점수가 좁은 고득점 대역에 몰려 선호/비선호 비디오 사이 격차가 줄고 RL 그래디언트가 거의 평탄해진다. 다른 하나는 context shift 하의 높은 분산으로, 같은 내용인데도 지시문이 바뀌거나 입력 순서가 달라지면 점수 스케일이 흔들려 일관된 점수나 페어와이즈 판단이 나오지 않는다. 저자들은 전문 인간 어노테이터가 점수를 바로 매기지 않고 먼저 평가 기준을 분해한다는 점에서 착안한다.

어떻게 동작하나

제안 프레임워크 RewardVerse는 평가 쿼리와 scorer 사이에 동적 루브릭을 중간 표현으로 끼워 넣는다. 입력은 목표 차원 d와 비디오 합성에 쓰인 텍스트 프롬프트 p의 쌍 q=(d,p)이고, 학습과 추론 모두에서 각 비디오는 독립적으로 채점된다(페어와이즈 위치 편향 회피). 첫 번째 모듈인 루브릭 생성기 π_gen은 쿼리 q만 보고 고정 스키마의 루브릭 R_q = {(t_k, w_k, T_k)}를 만든다. t_k는 평가 테마, w_k는 합이 1인 가중치, T_k는 쿼리에 기반한 실행 팁이다. 중요한 설계는 생성기가 비디오 y를 보지 않는다는 점이다. 후보 비디오를 보면 저품질 비디오에 관대해지거나 고품질에 엄격해지는 편향이 생기므로, 이를 차단해 평가 객관성을 지키면서 기준은 쿼리에 맞게 적응시킨다. 두 번째 모듈인 scorer π_sco는 테마마다 점수를 하나씩 낸다. JSON 파싱 대신 1~5 정수 토큰의 로짓 l_v를 읽어 기대값 c_k(y|R) = Σ_{v=1}^{5} v · P_θ(v|y,t_k,T_k)를 계산하고(soft-logits), 최종 점수는 테마 점수의 가중합 S(y|R) = Σ_k w_k · c_k(y|R)이다. 생성기와 scorer는 같은 백본을 공유하고 역할별 프롬프트로 구분된다.

무엇과 다른가

이 협업 파이프라인을 적은 선호쌍으로, 사전 SFT 없이 학습하기 위해 Rubric-Guided Policy Optimization(RGPO)이라는 2단계 알고리즘을 쓴다. 1단계는 seed rubric으로 scorer를 워밍업한다. 차원마다 frontier MLLM(Gemini-3.1-Pro)을 돌려 30개 선호쌍에 대해 제안-검증-수정 루프를 수행한다. 루브릭 후보가 선호 비디오를 비선호 비디오 위로 올리는지 검증하고, 실패하면 비평을 바탕으로 고친다. 통과한 루브릭은 2단계 Jaccard 필터로 중복 제거하고 MCR^2 샘플러로 M=5개 대표 항목으로 줄여 R*_d를 만든다. 이 고정 루브릭 아래에서 scorer는 GRPO로 학습하되, 페어와이즈 선호 보상 r_pref = σ(S(y_w) - S(y_l))와 포맷 보상, 그리고 인간 점수 마진에 맞추는 캘리브레이션 손실 L_cal = |(S(y_w|R) - S(y_l|R)) - Δŝ_{w,l}| / (S_max - S_min)을 함께 최소화한다. 선호 순위만 맞추면 점수 차이의 크기는 통제되지 않기 때문에 마진 캘리브레이션이 필요하다는 것이다. 2단계는 루브릭 생성기를 쿼리 적응적으로 최적화한다. 생성기가 쿼리마다 G개의 동적 루브릭을 샘플링하고, 각 루브릭은 선호/비선호 비디오를 얼마나 잘 분리하는지로 평가된다. 보상은 R_2 = r_pref + β·r_fmt + λ·r_align이고, r_align은 생성된 테마와 seed 테마의 BGE-M3 임베딩 코사인 유사도다. 여기서 비대칭 최적화 신호가 핵심이다. 생성기는 루브릭 수준 GRPO로 학습하지만, scorer는 R_2로부터 직접 policy gradient를 받지 않고 마진 캘리브레이션 손실로만 학습한다. scorer가 점수 차이만 키우는 방향으로 도망가는 것을 막기 위해서다. 생성된 루브릭은 scorer 손실 계산 시 고정 텍스트 컨텍스트로 취급되어 역전파되지 않고, α(t) 스케줄로 생성기 워밍업 이후에 캘리브레이션을 켠다.

어떻게 쓰나

저자들은 먼저 240개 pointwise 비디오(인간 라벨 포함)로 2x2 절제 실험을 한다. 축은 루브릭 유무와 디코딩 형식(natural-language 생성 vs soft-logits 연속 기대값)이다. 결과는 세 가지다. 첫째, 루브릭이 인지적 앵커로 작동한다. 루브릭 없이 직접 채점하면 점수 포화와 좁은 분산이 심한데, soft-logits 형식을 고정하고 루브릭을 넣으면 Qwen2.5-VL-7B의 점수 표준편차가 0.258에서 0.471로 82.6% 커진다. natural text 생성에서는 Qwen이 0.203에서 0.275로 늘고, 과도하게 노이즈가 크던 Gemini-3.1-Pro는 1.500에서 1.158로 줄어 인간 판단 분산에 가까워진다. 둘째, 루브릭만으로는 부족하다. 루브릭과 natural text를 결합한 변형에서는 비교쌍의 3분의 2가 여전히 tie로 남는데, 자연어 출력이 모델의 고득점 언어 사전확률에 묶여 있기 때문이다. 그래서 1~5 평가 토큰 로짓에서 연속 기대 점수를 뽑는 soft-logits를 루브릭과 결합한 구성을 최종 배포 형태로 택한다. 셋째, 그럼에도 한계가 남는다. 정적 루브릭은 쿼리별로 테마·팁·가중치를 바꾸지 못하고, Gemini-3.1-Pro 같은 강한 모델도 예측 점수 분포가 인간 평가와 어긋날 수 있다. 이것이 RGPO로 생성과 채점을 함께 최적화하는 동기가 된다.

전제와 한계

실험은 두 벤치마크에서 이뤄진다. EvalVerse에서 16개 세부 차원의 pointwise 상관을 보고, 외부 대규모 페어와이즈 벤치마크 VideoGen-RewardBench(VGRB, 26.5K 이상 비디오 쌍)에서 전이를 본다. VGRB는 Visual Quality 분할을 본 차원 전이로, Text Alignment 분할을 보지 못한 차원 전이로 쓴다. 학습 백본은 Qwen2.5-VL-7B이고, 비교 대상은 VideoScore-v1.1, VideoScore2, UnifiedReward(및 thinking 변형), VideoReward, VisionReward, Q-Scorer, 그리고 내부 기준선인 Raw-seed Rubric과 Raw-rubric이다. EvalVerse 16차원에서 RewardVerse는 14개 차원에서 최고 PLCC를 기록했다. 특히 인지·시간 과제에서 격차가 크다. Logic은 PLCC 0.750으로 차선 0.593을 크게 앞서고, Action은 0.566 대 0.390이다. 외부 비디오 scorer가 이 세부 축에서 잘 캘리브레이션되지 않는다는 점도 드러난다. 예컨대 VideoScore-v1.1은 Logic에서 PLCC가 -0.245다. VGRB에서는 non-oracle 기준선 중 두 분할 모두 최고 성능을 냈다. 차원당 30쌍, 총 480쌍만으로 학습했는데도 본 차원인 Visual Quality에서 가장 강한 non-oracle 기준선 VisionReward를 Acc w/ Tie 기준 7.1%p, Acc w/o Tie 기준 7.0%p 앞선다. 보지 못한 Text Alignment 분할에서도 0.471(tie 포함), 0.623(tie 제외)로 최고 정확도를 낸다.

절제 실험은 480쌍 예산에서 EvalVerse 매크로 평균 PLCC와 SRCC로 측정한다. 루브릭 없이 직접 pointwise 학습을 하면 zero-shot 대비 개선이 미미하고 전체 RGPO에 크게 못 미친다. 즉 데이터가 적을 때 쿼리와 scorer 사이에 루브릭을 넣는 것이 효율의 핵심이다. 1단계 scorer 워밍업을 빼면 PLCC가 0.099, SRCC가 0.061 떨어져, 동적 루브릭 학습 전에 scorer를 캘리브레이션하는 것이 중요하다는 게 확인된다. 2단계 공동 최적화를 건너뛰면 전체 모델 대비 PLCC 0.074 격차가 나서, 루브릭을 쿼리별로 적응시키는 효과가 드러난다. 하류 과제로는 Wan-2.2-A14B를 Visual Quality에 대해 GRPO 파인튜닝할 때 RewardVerse를 보상으로 쓴다. Imaging Quality가 0.640에서 0.653으로 오르고, VBench-Quality는 0.808에서 0.809로 유지되며, VBench-Text는 0.428에서 0.446으로 개선된다. 반면 VideoReward를 보상으로 쓰면 Imaging Quality는 0.648까지 오르지만 VBench-Quality가 0.804, VBench-Text가 0.392로 떨어진다. 목표 품질을 올리면서 다른 능력을 덜 망가뜨린다는 주장이다.

실무에서 이 논문이 유용한 지점은 비디오 생성 모델의 RL 파인튜닝에서 보상이 좁은 대역에 붕괴하거나 프롬프트에 따라 스케일이 흔들리는 문제를 겪을 때다. 루브릭이 중간 표현으로 남아 있어 점수가 왜 그렇게 나왔는지 추적할 수 있다는 점도 디버깅에 도움이 된다. 다만 도입 전에 확인할 전제가 있다. 점수 스케일이 1~5로 고정되어 있고, seed 루브릭 생성에 Gemini-3.1-Pro급 frontier MLLM을 오프라인 루프로 돌려야 하며, 차원당 30개 선호쌍이라는 저데이터 설정에서 검증됐다는 점이다. 또한 절대 점수 회귀가 아니라 상대 마진 캘리브레이션을 택했으므로, 절대 점수의 절대값 자체를 신뢰해야 하는 용도에는 맞지 않을 수 있다. 루브릭 생성기가 비디오를 보지 않는다는 설계도 그대로 유지해야 하는 제약이다.

저자들이 명시한 한계는 분명하다. 루브릭 프롬프팅만으로는 scalar drift를 완전히 해결하지 못하고, 정적 루브릭은 쿼리마다 테마·팁·가중치를 적응시키지 못한다. RGPO를 적용한 뒤에도 예측 점수 분포가 인간 평가와 어긋날 여지가 남아 있으며, 이는 Gemini-3.1-Pro 같은 강한 독점 MLLM에서도 마찬가지다. 캘리브레이션도 절대 점수 회귀 대신 상대 마진에 집중했는데, 저데이터 환경에서 절대 점수 회귀가 과적합되기 쉽기 때문이라고 밝힌다. 즉 이 방법은 선호 순서와 점수 차이의 신뢰도에는 강하지만, 절대 점수의 정확한 스케일 보정까지 보장하지는 않는다.

관련 논문