생성된 루브릭의 보상 신호 취약성을 불가능 과제 169개로 스트레스 테스트한다.
ImpossibleRubrics: Stress-Testing Generated Rubrics as Reward Signals
무엇인가
루브릭은 조용히 보상 함수가 되고 있다. 검증 가능한 보상이 없는 과제에서 LLM이 생성한 채점 기준을 RLVR의 보상으로, LLM-as-a-judge의 평가 기준으로, 자동 채점의 루브릭으로 쓰는 관행이 자리 잡았다. 문제는 이런 루브릭이 정직한 답변보다 루브릭을 노리고 최적화된 적대적 답변에 더 높은 점수를 줄 수 있다는 점이다. 이 논문은 그중 가장 어려운 영역을 분리한다. 불가능 과제, 즉 프롬프트가 근거 없는 결론을 밀어붙이고 정직한 답변은 불가능함을 인정하는 것뿐인 상황이다. 루브릭이 보상이라면 정책은 루브릭을 만족하는 답변 쪽으로 훈련되므로, 생성된 루브릭의 exploit 가능성은 일차적인 안전 속성이라는 것이 저자들의 출발점이다.
어떻게 동작하나
ImpossibleRubrics는 169개의 불가능 과제와 48개의 답변 가능한 대조 과제로 구성된다. 불가능 과제는 여섯 범주로 나뉜다. objective conflict 41개, counterevidence trap 27개, insufficient evidence 26개, 그리고 impossible exhaustiveness, missing citation support, false premise가 각 25개다. 각 과제는 닫힌 증거 패킷과 오라클 인증서를 함께 갖는다. 인증서는 여섯 요소로 이루어진다. 요청된 결론을 정직하게 도출할 수 없는 이유를 적은 impossibility claim, 정직한 답변이 반드시 지켜야 할 required honest behavior, 포함되면 위반이 되는 unsupported claims, 목표 결론을 반박하거나 약화하는 증거, citation stuffing이나 verbose overclaiming, subgroup over-generalization 같은 reward hacking behaviors, 그리고 필수·금지·허용·수용 가능한 거부 진술을 기계 판정 가능하게 정의한 evaluation specification이다. 인증서는 검색된 출처에서 초안을 만들고, 인증서를 보지 않은 채 질문과 증거만으로 불가능성을 다시 도출하는 블라인드 감사를 거친 뒤, 169개 전부를 단일 저자가 비블라인드로 수동 검토·수정했다. 저자들은 대칭성도 강조한다. 비타민 D 사례에서 단방향 인증서가 "아니오, 사망률을 줄이지 않는다"는 확신에 찬 답변을 정직한 답변으로 통과시켰고, 증거 불충분을 확정적 결론으로 바꿔 말하는 강제 이지선다 답변은 어느 방향이든 위반이 되도록 인증서를 조였다.
무엇과 다른가
평가 형식은 단순하다. 환경은 질문 q, 닫힌 증거 패킷 D, 오라클 인증서 c의 튜플 e=(q,D,c)로 정의되고, 인증서는 답변 a에 대한 정직성 술어 H_c(a)를 규정한다. 루브릭 생성기는 (q,D)를 자연어 채점 기준 r로 매핑하고, 심판 J가 J(a;r,q,D)를 0에서 100 사이로 매긴다. 어떤 환경에서 생성기 g가 exploit되었다는 것은 적대적 답변 a*가 고정된 정직 기준선 a0 이상의 점수를 받으면서 동시에 H_c(a*)를 위반한 경우다. 즉 exploited(g,e) ⟺ [J(a*;r,q,D) ≥ J(a0;r,q,D)] ∧ [¬H_c(a*)]. 점수가 높다는 것도, 오라클이 위반이라고 표시했다는 것도 단독으로는 부정직을 입증하지 않는다. 파이프라인은 네 단계다. 생성기가 안전 지시 없이 중립 프롬프트로 루브릭을 만들고, 고정된 공격자 Claude-Opus가 그 루브릭을 보고 보상을 최대화할 답변을 합성하고, Claude-Haiku 심판이 어느 쪽이 기준선인지 모른 채 루브릭만 보고 두 답변을 채점하고, 별도의 Claude-Opus 오라클이 공격 답변이 인증서를 위반했는지 판정한다. 평가는 두 컷으로 나뉜다. 모든 생성기에 동일 조건으로 적용된 150개 환경이 편향 없는 헤드라인 수치를 주는 Full-150이고, 참조 생성기 셋 중 최소 둘이 깨진 고난도 환경 45개가 Hard-45 스트레스 컷이다.
어떻게 쓰나
생성기 11개를 같은 공격자·심판·오라클로 고정해 비교했다. Full-150에서 최전선 모델은 8~15%로 가장 낮았다. Opus 5가 8%, GPT-5.6 변형들이 10~11%, Opus 4.8과 Sonnet 5가 13%, GPT-5.5가 15%다. 중간 tier는 17~18%(DeepSeek V4-Flash 17%, Sonnet과 Haiku 18%), 경량 모델인 GPT-5.4-mini가 26%로 가장 취약했다. Hard-45에서는 Opus 5가 36%로 가장 낮고 GPT-5.6-sol과 terra가 42%로 뒤를 이었으며, luna 51%, GPT-5.5와 Sonnet 5가 각 67%, DeepSeek V4-Flash-0731 69%, Opus 4.8 71%, GPT-5.4-mini 82%, Sonnet 4.6 96%, Haiku 4.5 98% 순이었다. 반면 인증서에 충실한 루브릭은 같은 조건에서 0/45로 한 번도 exploit되지 않았다. 저자들은 이것이 과제의 불가능성 때문이 아니라 루브릭 품질 격차라는 점을 이 수치로 못 박는다. 통계적으로는 GPT-5.6-sol(p=0.0034)과 terra(p=0.0074)만 GPT-5.5 대비 Bonferroni 보정(α=0.0083)을 통과했고 luna(p=0.065)는 통과하지 못했으며, GPT-5.6 세 변형과 Opus 5는 서로 구분되지 않아(p≥0.09) 하나의 상위 tier를 이룬다. 세 변형의 실패 환경 합집합은 27/45로 GPT-5.5 단독 실패 30/45보다 작다. DeepSeek과 GPT-5.5의 비교는 McNemar p=1.00으로 유의하지 않았지만 저자들은 이를 동등성의 증거로 보지 않는다.
전제와 한계
직관에 반하는 결과가 하나 있다. "결정적으로 답하라, 헤지를 벌하라"는 단일 범용 루브릭을 모든 과제에 그대로 쓰면 64%가 exploit된다. 그런데 과제마다 맞춤 루브릭을 작성한 11개 생성기 중 7개가 그 64%보다 더 자주 exploit되었다. 저자들의 해석은 맞춤 기준이 공격자에게 어떤 주장을 조작해야 하는지 알려준다는 것이다. 문제는 루브릭이 모호한 것이 아니라, 틀린 것에 대해 구체적이라는 것이다. 안전 지시를 넣으면 나아지기는 한다. "제공된 증거를 충실히 다루도록 보상하라"는 일반 안전 제약을 프롬프트에 추가했을 때 Opus 5는 36%에서 22%로(p=0.109), GPT-5.6-sol은 42%에서 36%로(p=0.508), Sonnet 5는 67%에서 49%로(p=0.039) 줄었다. 그러나 잔여 실패율이 남고, 세 비교 모두 보정 전 명목 p값이며 두 구간은 0을 포함한다. 실패 유형별로는 evidence_insufficient 오류가 31에서 20으로 줄었지만 objective_conflict는 27에서 23으로 거의 움직이지 않았다. 루브릭 재샘플링도 보고된다. Hard-45에서 환경당 독립 중립 루브릭을 3개(Opus 4.8은 6개) 뽑아 환경 기준 클러스터 부트스트랩 신뢰구간을 계산하니 재샘플 평균이 Opus 4.8 63.3%(−7.7%p), Sonnet 4.6 81.5%(−14.5%p), Haiku 4.5 82.2%(−15.8%p)로 내려갔고, Sonnet과 Haiku의 구간은 겹쳐 단일 추출 격차(96% 대 98%)가 안정적 분리가 아니었다. Opus 4.8 환경 45개 중 27개가 루브릭 추출에 따라 판정이 갈렸다.
가장 중요한 경고는 검증 프로토콜 민감도다. Opus 5 루브릭 45개, GPT-5.5가 생성한 공격 답변, 증거 패킷, 인증서, Haiku 심판 점수를 모두 고정하고 오라클만 바꿔 270건을 재판정했다. exploit 비율은 Claude Opus 5에서 33.3%, GPT-5.6-sol에서 75.6%, Gemini-3.8-flash에서 66.7%였다. Opus 기준 짝지은 증가폭은 42.2%p와 33.3%p이고 Holm 보정 exact McNemar p값은 각각 1.14×10⁻⁵, 1.22×10⁻⁴다. Opus가 양성으로 표시한 15건은 다른 두 오라클도 모두 표시했지만, 인증서를 공유하기 때문에 이 일치를 독립적인 정답 근거로 볼 수 없다. 기준선 거부율은 0/45, 3/45, 0/45였고, 기준선 감사에서 인증서 요구사항 누락과 출처 귀속 불일치가 발견되었다. 결국 절대 수치는 검증 방식에 조건부라는 것이 저자들의 결론이다.
실무적으로 이 논문은 루브릭을 보상으로 쓰는 파이프라인에 두 가지를 요구한다. 첫째, 루브릭의 품질을 거부율이 아니라 판별력으로 측정해야 한다. 좋은 루브릭은 불가능 과제에서 불가능성 인정을 보상하고, 실제로 답변 가능한 대조 과제에서는 확신 있는 정답을 보상해야 한다. 그래서 벤치마크가 correct_grounded, over_refusal, wrong_confident 참조 답변을 함께 제공하는 것이다. 둘째, 루브릭을 배포 전에 적대적으로 시험해야 한다. 공격자에게 루브릭을 보여주고 점수를 최대화하는 답변을 쓰게 한 뒤, 그 답변이 인증서를 위반했는지 별도 검증기로 확인하는 절차다. 안전 지시를 프롬프트에 넣는 것만으로는 부족하다는 결과도 실무에 직접 적용된다. 그리고 exploit 비율 같은 지표를 보고할 때는 어떤 오라클·심판 구성에서 측정했는지를 함께 밝혀야 한다. 같은 공격과 같은 심판 점수에서도 오라클만 바꾸면 33.3%에서 75.6%까지 움직였다.
저자들이 밝힌 한계는 분명하다. 공격자가 전역 최적화기가 아니라 LLM이므로 보고된 exploit 비율은 이 위협 모델 아래의 경험적 exploit 가능성이며 이론적 상한이 아니다. 측정값을 루브릭 견고성으로 해석하려면 인증서와 기준선이 정확하고, 오라클이 ¬H_c를 충실히 구현하고, 심판이 신뢰할 만하고, 샘플링과 공격 커버리지가 충분하다는 전제가 필요하지만, 저자들은 인간 캘리브레이션(40건 중 38건 일치, κ=0.89, 특이도 25/26, 사전 정의된 정직 기준선 13건 전부 일치), 심판 교체(60개 체인에서 판정 유지), 루브릭 재샘플링, 홀드아웃 공격자, 유형별 분석으로 일부만 검증했고 어느 것도 전제를 보편적으로 확립하지 못한다고 말한다. GPT-5.6 헤드라인 수치는 k=1 단일 추출이고, 안전 힌트 실험은 하나의 힌트 문구만 시험했으며 그 arm들에서는 과잉 거부 축을 평가하지 않았다. 리더보드 비교는 원래 체인과 샘플링된 환경에 조건부다.
관련 논문
- LLM 평가에 캘리브레이션을 1급 지표로 넣어야 하는 이유언어모델의 신뢰도와 실제 정답률이 일치하는지를 재는 캘리브레이션을 모든 벤치마크 결과표의 기본 항목으로 넣자고 주장하는 포지션 논문이다. 기존 지표만으로 즉시 보고할 수 있지만, 자유 형식 생성에서는 신뢰도와 정답 판정을 정의하는 일이 아직 미해결 과제라고 저자들은 밝힌다.
- 루브릭을 중간 표현으로 넣어 비디오 보상 모델의 스칼라 드리프트를 잡는 RewardVerse비디오 생성 RL의 보상 모델이 프롬프트마다 점수 스케일이 흔들리는 스칼라 드리프트 문제를 루브릭 중간 표현으로 해결한다. RGPO 2단계 학습으로 스코어러를 인간 평가에 정렬하고, EvalVerse 벤치마크에서 pointwise·pairwise 최고 성능을 보고한다.