웹 에이전트가 스스로 검증 문항을 인증해 보상과 선택에 재사용한다
CLIFT: Conformal Self-Verification for Web Agent Training and Test-Time Scaling
무엇인가
오픈소스 웹 에이전트는 이제 실제 브라우저 작업을 수행할 만큼 강해졌지만, 강화학습으로 더 훈련시키는 일은 검증기(verifier)에서 막힌다. 이진 성공 신호는 배포하기는 쉽지만 credit assignment에는 너무 희소하다. GRPO 그룹 안의 모든 롤아웃이 같은 결과를 받으면 advantage 추정이 붕괴한다. 프런티어 언어모델 judge는 더 풍부한 피드백을 주지만 훈련 중 비용이 크고 테스트 시점에 쓸 수 있다고 가정할 수 없다. 논문은 이 tension이 웹 에이전트 벤치마크에서 특히 선명하다고 지적한다. WebArena Infinity(WAI)는 앱별 프로그램 검증기를, VisualWebArena(VWA)는 결과 기반 URL/DOM 검사를, Online Mind2Web(OM2W) 같은 라이브웹 스위트는 노이즈 있는 LLM judge를 쓴다. 정책 자체만이 병목이 아니라, 롤아웃을 점수화하고 선택하는 방식이 관측 성공률을 지배할 수 있다는 것이 문제 설정이다.
어떻게 동작하나
CLIFT의 핵심 객체는 새 모델이 아니라 교정된 검증기, 즉 질문·URL 범위·극성 부호·conformal 신뢰 가중치의 집합이다. 에이전트 행동에 대한 예/아니오 자연어 검증 질문(VQ) 은행을 유지하는데, 각 질문 q는 URL 패턴과 극성 σ_q ∈ {-1, 0, +1}(진행·실패·모호)을 갖는다. Compositional Conformal Certifier(CCC)는 질문과 URL 계층 τ ∈ {global, host, URL-path}마다 Mondrian-ACI 트래커를 두고, 극성 인식 비순응 점수를 계산한다. 양성 질문은 YES가 높은 judge 점수와 일치할 때, 음성 질문은 YES가 낮은 점수와 일치할 때 conform한다. 중립 질문은 인증되지 않는다. 인증 조건은 관측 수 n이 최소치 이상, α가 α* 미만, lift 절댓값이 최소치 초과, σ ≠ 0 네 가지다. 인증된 질문은 w = σ·|lift|·max(0, 1 − α/α*) ∈ [-1, +1]의 부호 있는 신뢰 가중치를 받고, URL u에서는 URL-path → host → global 순으로 가장 구체적인 인증 계층을 조회한다. 은행은 judge에 근거한 시드 질문에서 시작해, 훈련 중 CEGAR 스타일 루프가 상위·하위 롤아웃을 가르는 새 URL 범위 질문을 제안해 키운다. 관측된 lift가 극성 태그와 모순되면 sanity veto가 해당 질문의 극성을 중립으로 강등한다.
무엇과 다른가
훈련에서 CLIFT는 GRPO 계열 정책경사법을 유지하되 보상 객체를 바꾼다. 하나의 비교 judge 호출이 GRPO 그룹 전체를 채점해 궤적 점수와 스텝 점수를 돌려주고, 동시에 자기검증기가 각 롤아웃의 URL 상태마다 은행 질문에 답한다. 스텝 보상은 r̃ = r_judge + β·max(0, R^VQ(u))로, 검증기 항이 0에서 클리핑되기 때문에 인증된 증거는 judge 신호를 강화할 수만 있고 끌어내릴 수는 없다. 이전 선형 블렌딩에서 나타나던 보상 붕괴를 막는 장치다. 스텝 보상을 할인해 리턴을 만든 뒤 (롤아웃 그룹, 스텝 위치, URL 상태) 셀 안에서 그룹 정규화해 advantage를 구하고, 이를 툴 호출 구간의 토큰에 방송한다. 구간 밖 토큰은 그래디언트를 받지 않는다. GRPO 업데이트 자체는 그대로지만 credit assignment가 URL 국소적으로 바뀐다.
어떻게 쓰나
테스트 시점에는 외부 judge를 버리고, 훈련 중 얼려둔 같은 은행을 Conformal Trajectory Selection(CTS)에 쓴다. 정책은 그리디 incumbent ρ_A와 하나 이상의 다양한 재시도 ρ_B를 뽑고, 자기검증기가 각 URL 흔적을 요약해 상태별 증거 기록을 만든다. 이 증거 시트와 행동 흔적, 최종 상태를 비교 프롬프트에 넣어 A(그리디 유지)·B(교체)·TIE 중 하나를 받는다. 검증기 분산이 해로운 교체를 일으키지 않도록 홀수 m번의 독립 호출에 보수적 다수결을 적용하고, 동점과 다수 A는 그리디를 유지한다. K는 결과 표에 보고되는 롤아웃 예산이고, m은 쌍별 비교에 쓰이는 검증기 투표 수다. 은행 조건부 비교가 우연보다 낫다면 CTS의 기대 성공률은 그리디 성공률에서 ε(m, δ)만큼만 낮아진다.
전제와 한계
실험은 세 갈래다. WAI는 주 훈련 설정으로, Gemma 4 31B에 LoRA를 붙여 URL-path/host/global CCC 계층 전체를 쓰고 1,886개 WAI 태스크와 1,272개 VWA 태스크를 16개 LoRA 샤드로 훈련한다. 훈련 시점 judge는 Claude Opus 4.6이고 CTS는 외부 judge를 호출하지 않는다. 공개 리더보드 비교에서 CLIFT로 훈련한 Gemma-4에 K=3 CTS를 붙인 구성이 비교 대상 공개 시스템 중 가장 높은 9개 앱 성공률을 기록했고, 9개 앱 중 7개에서 이겼으며 같은 Gemma-4 browser-use 백본을 전체 12.8%p 끌어올렸다. 절제 실험 수치는 Gemma-4 베이스 61.8, 바닐라 GRPO 64.7(+2.9), CLIFT 72.6(+10.8), CLIFT+CTS 74.6(+12.8), Opus 4.6 참조 69.8(+8.0)이다. 성공 궤적의 평균 스텝 수는 각각 15.4, 18.5, 16.0, 15.5로, 바닐라 GRPO가 스텝을 18.5까지 늘리면서 2.9점만 얻은 것과 달리 CLIFT는 16.0 스텝에서 10.8점을 얻는다. CTS는 17.8% 교체율로 2.0점을 더하면서 앱별 성능 하락은 0건이었다.
VWA는 이전(transfer) 설정이다. 오픈 모델 훈련 중 만든 은행을 그대로 GPT-5.5의 추론 시점에 붙이는데, 정책 가중치는 고정이고 CTS 선택만 추가한다. K=4에서 가중 평균 53.7로 WALT의 52.9 참조를 근소하게 넘었고 세 환경 모두에서 이득을 봤다. 사람 성능은 여전히 모든 에이전트보다 훨씬 높다. OM2W는 가장 어려운 라이브웹 이전 설정으로, 약 30개 공개 도메인에 걸친 300개 태스크를 LLM 루브릭으로 채점하며 어떤 정책도 OM2W 데이터로 훈련되지 않는다. WAI/VWA 은행에서 캐낸 질문을 라이브웹 실패 모드(봇 차단 페이지, 환각 추출, 부분 필터 적용, 잘못된 최종 답 정지)에 맞게 고쳐 recalibration한 결과 132개 중 100개 질문이 인증됐다. Gemma-4는 40.0에서 45.0으로 올라 같은 judge 기준 GPT-5.5 저노력 베이스라인 43.7을 넘었고, GPT-5.5 고노력 백본에서는 49.7에서 61.0으로 K=4에서 +11.3%p 올랐다. 이전되는 것은 정책이 아니라 인증된 질문 분류체계와 교정 레시피라는 것이 저자들의 정리다.
개발자 관점에서 이 논문의 실용적 요점은 검증 자산을 한 번 만들어 훈련과 배포 양쪽에서 재사용한다는 설계다. 궤적 점수는 한 번 소비되고 끝나지만, 인증된 질문 은행은 URL 범위·극성·신뢰 가중치·judge 근거 출처를 함께 들고 있어 검사하고 재교정하고 재사용할 수 있다. 새 도메인에 적용할 때 정책 업데이트 없이 judge가 채점한 롤아웃 샘플만으로 recalibration을 시작할 수 있다는 점, 그리고 검증기 항이 0에서 클리핑되어 기존 보상 기준선을 절대 깎지 않는다는 점은 기존 RL 파이프라인에 얹기 쉬운 성질이다. 다만 은행이 특정 벤치마크의 URL 패턴에 묶여 있으므로, 자기 서비스에 적용하려면 도메인별 질문 번역과 lift 재측정을 먼저 해야 한다.
저자들이 밝힌 한계는 분명하다. 오픈 웨이트 백본 하나만 훈련했고, 훈련과 은행 구축 전반에 프런티어 judge에 의존한다. 그 judge가 체계적으로 편향되어 있으면 교정은 관측 데이터로 드러난 불일치만 감지할 수 있다. 이전 결과는 은행이 더 강한 폐쇄형 에이전트에 도움이 될 수 있음을 보여줄 뿐, 하나의 은행이 모든 웹 도메인에 보편적이라는 뜻은 아니다. OM2W처럼 judge가 노이즈할수록 인증되지 않고 남는 질문이 많아지는데, 저자들은 이 거부를 조용한 붕괴가 아니라 현재 judge·상태 분할·질문 은행이 신뢰할 만한 증류를 지지하지 않는다는 진단으로 본다. 또한 강한 오픈 웹 에이전트는 오용 위험이 있으므로 배포 시 속도 제한과 도메인별 안전장치를 유지해야 한다고 적었다. 향후 과제로는 자연어 질문을 코딩 에이전트가 작성한 실행 가능한 브라우저 상태 단언으로 대체해, 별도 자기검증 은행 의존을 줄이면서 감사 가능성을 유지하는 방향을 제시한다.