VeriFine이 정책과 심판을 함께 키워 자기개선을 지속시킨다
VeriFine: Scaling Verification for Self-Improvement in Embodied Reasoning
무엇인가
자기개선 루프에서 정책이 좋아질수록 실패 양상도 바뀌는데, 이를 평가하는 심판(judge)이 고정되어 있으면 검증이 곧 병목이 된다. 정책이 심판의 검증 경계에 가까워지거나 넘어서면 피드백이 부정확해지고 보상 해킹, 분포 이동, 심지어 성능 저하로 이어진다. 정적 학습 데이터도 마찬가지다. 이미 잘 푸는 시나리오가 분포를 차지하면서 학습 신호가 줄어든다. 체화된 추론(embodied reasoning)에서는 공간 그라운딩, 시간 이해, 인과 추론, 안전 인식 의사결정까지 평가해야 해서 문제가 더 심하다. 기존 연구는 행동 품질이나 과제 완료 여부를 주로 보거나, 제약된 질의응답 형식과 값비싼 인간 주석 참조에 의존했다. LingoJudge조차 시각 정보를 쓰지 않고 인간 추론과 비교만 한다.
어떻게 동작하나
VeriFine은 정책, 훈련 커리큘럼, 심판을 함께 진화시키는 에이전트 하네스(agent harness)다. 핵심은 두 개의 맞물린 개선 루프다. 검증의 기반은 참조 없는(reference-free) 루브릭 심판으로, 물리적 맥락 x와 정책 출력을 받아 종합 점수 s, 구조화된 진단 점수 z, 선택적 평가 설명 e를 낸다. 루브릭은 행동(Action)과 구성요소(Component) 두 축으로 나뉜다. 운전을 예로 들면 Action은 지시 일관성과 안전성을, Component는 시각적 그라운딩, 행동에 관련된 장면 요소의 포괄성, 그리고 제안된 행동과의 인과 관계를 평가한다. 비용 문제 때문에 프런티어 VLM인 Claude Opus 5를 교사로 두고, 그 평가 능력을 Qwen3-VL 2B 백본의 소형 학생 모델로 증류한다.
무엇과 다른가
정책 개선 루프는 심판이 찾아낸 실패 패턴을 훈련 결정으로 바꾼다. 현재 정책이 인간 전문가가 품질 검수한 앵커 평가셋(2,134개)에서 출력을 생성하면, 심판이 이를 평가해 점수와 진단 점수 묶음을 만든다. 에이전트는 이 결과를 시나리오와 루브릭 차원에 걸쳐 집계해 반복되는 실패 패턴을 찾고, 체계적 오류와 고립된 실패를 구분한 뒤 후보 데이터 풀에 대한 실행 가능한 선택 기준으로 옮긴다. 선택은 두 가지 목적을 동시에 가진다. 정책이 약한 맥락을 우선순위로 올리는 것과, 신뢰할 수 없는 학습 대상을 걸러내는 것이다. 정책 약점이 드러나는 시나리오는 학습에 가치가 있지만, 그 시나리오에 대한 잘못된 응답은 지도 학습 시연으로는 부적합하다. 커리큘럼을 구성한 뒤 정책을 갱신한다. 운전 추론에서는 GRPO 기반 강화 미세조정을 쓰고 심판의 종합 점수를 보상으로 삼되, KL 항으로 참조 정책에서 과도하게 벗어나지 않게 정규화한다. 로봇 내비게이션에서는 지도 미세조정을 쓰고, 심판 점수는 보상이 아니라 훈련 집합 포함 여부를 결정하는 데만 쓰인다.
어떻게 쓰나
심판 개선 루프는 검증이 병목이 될 때 작동한다. 인간 주석에 기반한 참조 심판 VeriFine-Judge-RB로 앵커 평가셋에서의 정책 성능을 모니터링하고, 최근 K번의 성능 변화 평균이 작으면(정체) 그리고 심판 보상 변화와 실제 성능 변화의 격차가 크면 루프를 발동한다. 이때 에이전트는 갓 갱신된 정책이 롤아웃한 출력에서 불확실하거나 일관되지 않거나 영향이 큰 사례를 모아 평가 집합을 만든다. 저점 사례도 의도적으로 남기는데, 심판의 결정 경계를 정의하고 정책 오류에 대한 반응을 보정하는 데 필요하기 때문이다. 이 집합은 이전 라운드 사례를 보존하는 누적 집합에 합쳐져, 새 보정이 기존 검증 능력을 훼손하지 않게 한다. 보정은 공동 능동 보정(coactive calibration) 방식이다. 인간 전문가가 먼저 물리적 맥락과 후보 출력을 보고 심판 점수를 거칠게 맞춘다. 그다음 에이전트가 루브릭 수정안을 반복적으로 제안·평가·선택하고, 인간 보정과의 정합성이 정체되면 논쟁이 된 사례를 구조화 진단 점수와 평가 설명과 함께 제시한다. 인간은 평가를 확인하거나, 특정 루브릭 차원을 바로잡거나, 불명확한 기준을 명확히 하거나, 심지어 자신의 이전 주석 점수를 수정할 수 있다. 인간 판단을 절대적 정답으로 취급하지 않고, 양쪽이 이견을 드러내며 해석을 다듬어 물리적 추론의 공유 잠재 루브릭에 수렴시키는 과정이다.
전제와 한계
실험은 운전 추론에서 3라운드로 진행됐다. 데이터는 25개국 인간 주행 200만 클립 규모의 내부 데이터셋이고, 앵커 평가셋 2,134개, 별도 정책 테스트셋 2,772개를 쓴다. 정책은 Alpamayo 1.5 8B에서 초기화하고 GRPO로 학습한다. 베이스라인은 무작위 선택 대비 심판 유도 선택, LingoJudge, VeriFine-Judge-RB이며, 공유 40만 풀에서 뽑은 2만5천 예시로 2,700 스텝을 최적화한다. 결과는 고정된 참조 기반 평가자 기준으로 정책 추론 점수가 60.56에서 71.61로 올라 18.2% 상대 개선을 보였다. 심판 유도 선택은 무작위 선택 대비 64.03에서 67.70으로 개선됐고, 첫 참조 없는 라운드는 67.30으로 가장 강한 참조 기반 구성(67.70)에 근접했다. 이후 라운드는 70.59, 71.61로 올라 R3는 최강 참조 기반 베이스라인을 5.8% 초과했다. 최종 정책은 학습에 행동 보상이 전혀 없었는데도 ADE가 가장 낮았다. 심판 쪽에서는 교사 상관계수가 0.55에서 0.85로, MAE가 0.25에서 0.13으로 좋아졌고, 최종 학생 모델은 r=0.82, MAE=0.17로 참조 기반 심판(0.82/0.16)과 비슷하고 LingoJudge(0.65/0.23)보다 나았다. Opus 5 백본을 고정한 상태에서도 공동 능동 보정이 상관계수를 0.67에서 0.85로 끌어올려, 백본 성능만으로 설명되지 않는 이득임을 보였다. 실패 유형별 결과도 눈에 띈다. R1 학생은 첫 라운드 테스트 하위셋에서 r=0.72였지만 이후의 어려운 하위셋에서는 r=0.07로 떨어졌고, 보정 후 R2에서 0.74로 회복됐다. 테스트타임 확장 실험에서는 401개 독립 시나리오에 대해 정책이 6개의 추론-행동 후보를 생성하고, 후보 예산이 6일 때 최종 심판이 고른 출력의 인간 평가 추론 점수는 78.6으로 R2 심판과 LingoJudge를 앞서고 VeriFine-Judge-RB와 비슷했다. 로봇 내비게이션(VLNVerse 시나리오, Qwen3-VL 2B 정책, SFT)에서는 정책 추론 점수가 68.09에서 77.59로 14% 올랐고 심판-인간 상관계수는 0.85에 근접했다.
실무적으로 이 논문이 던지는 메시지는 검증기를 고정 자산으로 두지 말라는 것이다. 정책을 학습시킬수록 평가 기준이 낡아지고, 낡은 평가자는 보상 해킹을 유도한다. 루브릭을 명시적 구조화 진단 점수로 분해해 두면 실패 원인을 차원별로 추적하고 커리큘럼 선택 기준으로 재사용할 수 있다. 또 프런티어 모델을 교사로, 소형 VLM을 학생으로 두는 증류 구조는 대규모 RL 루프에서 검증 비용을 감당 가능한 수준으로 유지하는 현실적인 선택이다. 인간 개입은 전면 재라벨링이 아니라 심판이 흔들리는 사례에만 선택적으로 투입된다. 강화학습이든 지도 미세조정이든 같은 루프가 적용된다는 점도 실무적으로 중요하다. 다만 도입 전에 확인할 것은, 자체 도메인에 맞는 앵커 평가셋과 동결된 심판 테스트셋을 확보했는지, 그리고 심판 점수와 실제 성능 사이의 격차를 모니터링할 지표를 갖췄는지다.
원문에는 별도의 한계 절이 없지만, 저자들이 명시한 전제는 짚어둘 필요가 있다. 각 라운드의 정책은 동일한 베이스 초기화에서 라운드별 학습 예산을 맞춰 새로 학습되므로, 개선은 하나의 정책을 계속 이어서 학습시킨 결과가 아니라 검증과 커리큘럼 과정을 통해 시스템 수준에서 누적된 것이다. 즉 이 프레임워크의 이득을 단일 체크포인트의 연속 학습 곡선으로 해석하면 안 된다. 또한 인간 판단은 절대적 정답이 아니라 보정 대상으로 취급되고, 심판 테스트 라벨은 동결되어 루브릭 개선에서 제외된다. 실험에 쓰인 앵커 평가셋, 테스트셋, 200만 클립 데이터셋은 모두 내부 자산이라 외부에서 그대로 재현하기 어렵다는 점도 감안해야 한다.