결과 점수만 보던 벤치마크 압축에 실행 과정 신호를 더한 DualViewEval

Beyond Outcomes: Dual-View Relational Learning for Efficient Agent Benchmarking

arXiv2609.18909v1

Xinshuai Guo2026-09-16조회 4

무엇인가

이 논문이 다루는 문제는 에이전트 벤치마크 평가가 일반 LLM 벤치마크보다 훨씬 비싸다는 것이다. 에이전트 평가는 장기 추론, 반복적 도구 사용, 상태를 가진 환경 상호작용을 요구하기 때문에 시간과 추론 자원이 크게 든다. 논문은 APEX-Agents 벤치마크에서 Claude Opus 4.8을 평가하는 데 약 10.9K 달러가 들고, Gemini 3.5 Flash를 평가하는 데는 이상적인 10방향 병렬화를 가정해도 약 2.7일이 걸린다고 제시한다. 에이전트를 수정하거나 새 모델을 투입할 때마다 이 비용이 반복되므로, 전체 벤치마크 점수와 에이전트 순위를 보존하면서 평가 비용을 줄일 수 있는지가 핵심 질문이 된다. 기존 압축 기법들은 대부분 비(非)에이전트 벤치마크용으로 개발됐고, 태스크-모델 최종 점수 분포의 중복만 모델링한다. 예를 들어 SparseEval은 결과 행렬의 열 사이 관계를 모델링할 뿐, 에이전트들 사이의 공유 구조나 각 결과 뒤의 실행 과정은 거의 무시한다. 그러나 에이전트 평가에서는 비슷한 최종 결과가 전혀 다른 행동에서 나올 수 있어, 결과만 보는 태스크 중심 압축은 불완전하다는 것이 저자들의 진단이다.

어떻게 동작하나

저자들은 먼저 궤적에서 과정 신호를 뽑아낼 수 있는지 확인한다. 공개 궤적이 있는 다섯 개 에이전트 벤치마크의 대규모 실행 추적을 분석하고, 이질적인 궤적 포맷을 검토한 뒤 모델 평가 실무자들과 상의해 벤치마크에 독립적이고 직접 관측 가능한 통계량 12개를 도출했다. 이 중 자동 추출이 안정적이고 의미적 중복이 제한적인 6개를 최종적으로 남긴다. 에이전트 스텝 수(의사결정·행동 턴 수로 궤적 길이와 실행 노력 반영), 도구 실패율(명시적 오류 상태를 가진 도구 호출 비율), 도구 범주 엔트로피(읽기·쓰기·검증·기타 호출에 대한 정규화 엔트로피), 검증 도구 비율(테스트·점검·사후 확인에 쓰인 호출 비율), 필수 쓰기 실행(외부 상태 변경이 필요한 태스크에서 쓰기 작업을 최소 한 번 수행했는지 나타내는 이진값), 읽기-쓰기-검증 폐쇄율(관찰된 맥락 뒤에 쓰기가 오고 그 뒤 성공적 검증이 따라오는 쓰기 에피소드 비율)이다. 논문은 예시로 어시스턴트 스텝 8회, 성공한 도구 호출 8회, 완료된 쓰기-검증 에피소드 1개가 원시 벡터 [8, 0, 0.272, 0.125, 1, 1]을 만든다고 설명한다. 저자들은 이 측정값들이 최종 점수와 체계적으로 함께 변하며, BFCL에서 저·중·고득점 모델이 서로 다른 과정 분포를 보인다고 보고한다.

무엇과 다른가

제안 방법 DualViewEval은 네 단계로 구성된다. 첫 단계에서는 태스크마다 같은 에이전트 구성으로 인덱싱된 두 개의 대칭 관계 행렬을 만든다. 결과 뷰는 에이전트 a의 결과를 u = [Y, 1-Y]로 인코딩하고 R^y_i = (1/2) U_i U_i^T로 정의해, 태스크 i에서 성공-실패 행동이 비슷한 에이전트 쌍에 더 큰 값을 준다. 과정 뷰는 표준화된 과정 프로파일과 관측 마스크를 결합한 v = [p̃ ⊙ o; o]를 쌓아 R^p_i = (1/2d) V_i V_i^T로 정의하며, 마스크를 곱해 대체 입력된 차원을 과정 기여에서 제거하고 마스크 자체를 붙여 어떤 측정값이 실제로 존재하는지 노출한다. 두 행렬 모두 양의 준정부호 그램 행렬이고 한 번만 미리 계산된다. 두 번째 단계에서는 태스크마다 학습 가능한 로짓 θ를 두고, 매 에포크마다 상위 K개 로짓을 뽑아 정확히 K개짜리 미니셋을 만든다. 이산 선택에 예측 피드백을 전달하기 위해 q = K·softmax(θ/τ)를 정의하고 straight-through 게이트 g = h + q - sg(q)를 사용한다. 순전파에서는 g가 하드 마스크 h와 같지만 역전파 그래디언트는 q에서 물려받는다. 미리 정한 1대1 교체 규칙이 아니라, 로짓이 Top-K 경계를 넘을 때마다 태스크가 들어오고 나가면서 예산은 정확히 유지된다.

어떻게 쓰나

세 번째 단계에서 선택된 관계 행렬들은 에이전트 커널 K_e = (1/K) Σ_i g_{e,i} (R^y_i + γ² R^p_i)로 융합된다. 학습되는 γ ∈ [0,1]는 과정 관계가 결과를 얼마나 강하게 보완할지 조절하고, γ²로 두어 융합 행렬의 양의 준정부호 구조를 보존하며, K로 나눠 미니셋 예산이 달라도 스케일을 비슷하게 맞춘다. 이 커널 위에서 Kernel Ridge로 전체 점수를 예측한다. 예측기는 선형 헤드로 제한되는데, 에이전트 벤치마크는 관측된 에이전트 구성 수가 태스크 수보다 훨씬 적기 때문에 예측기 용량을 제한하면서 선택된 커널에 대해 미분 가능하게 유지하기 위해서다. 선택기가 자기 예측으로 보상을 받는 것을 막기 위해 학습 에이전트를 B개 폴드로 나누고, 각 폴드를 나머지 학습 에이전트로 예측한 out-of-fold 예측에 대해 손실 L = L_score + λ_r·L_rank를 최적화한다. L_score는 Smooth-L1 오차로 절대 점수 수준을, L_rank는 쌍별 로지스틱 손실로 상대적 순위를 보존한다. 이 손실 하나가 태스크 로짓 θ, 전역 과정 가중치 γ, Ridge 정규화 α를 동시에 갱신한다. 네 번째 단계에서는 각 에포크가 만든 하드 미니셋과 예측기 상태를 검증 에이전트에서 MAE와 순서 오류로 평가하고, 두 기준의 순위를 더한 값이 최소인 에포크를 고른다. 두 기준을 순위로 바꿔 더함으로써 스케일 의존적인 트레이드오프 계수를 하나 더 도입하지 않는다.

전제와 한계

실험은 BFCL, τ²-Bench, Terminal-Bench 2, SWE-bench Verified, APEX-Agents 다섯 개 벤치마크에서 수행됐고, 공개 리더보드와 관련 릴리스에서 점수와 궤적을 수집해 정렬된 결과-궤적 행렬을 구성했다. 비교 대상은 Anchor Points, gp-IRT, TailoredBench, EssenceBench, SparseEval 다섯 개다. 에이전트를 60/20/20으로 나누고, B=5 교차 적합, Adam, 학습률 0.05, 순위 손실 가중치 0.05, straight-through 온도 1.0에서 0.1로 감소, 태스크 로짓은 N(0, 0.01²)로 초기화, γ0=0.1, α0=1.0을 사용해 1,000 에포크 학습한다. 평가 지표는 MAE와 Kendall τ다. 열 번의 분할 결과에서 DualViewEval은 모든 벤치마크에서 최고 성능을 냈고, 가장 직접 비교되는 결과 기반 예측 베이스라인인 SparseEval 대비 벤치마크 평균 MAE를 30.5~45.1% 줄이면서 평균 Kendall τ를 0.089~0.115 높였다. 가장 빡빡한 예산의 APEX-Agents에서는 MAE를 34.3% 줄이고 τ를 0.100 높였다. 초록 기준으로는 20개 태스크만으로 APEX-Agents와 BFCL에서 24~40배 압축을 달성하고, 가장 강한 경쟁자 대비 MAE를 14.5~28.2% 줄이며, SWE-bench Verified에서 EssenceBench 대비 Kendall τ를 최대 7.2% 개선했다고 보고한다. 다만 같은 논문의 기여 요약에서는 이 τ 개선폭을 최대 5.4%로 적고 있어 두 수치가 일치하지 않는다.

절제 실험은 각 구성 요소의 기여를 분리한다. 과정 관계 행렬을 빼거나 결과 관계 행렬만 쓰는 변형과 비교했을 때, 결과 관계 행렬이 점수 재구성의 주된 신호를 제공하고 과정 관계 행렬은 이진 결과만으로는 얻을 수 없는 행동 구조를 보완하며, 둘의 결합이 데이터셋과 미니셋 예산 전반에서 가장 좋은 정확도-순위 균형을 준다. APEX-Agents에서는 과정만 쓰는 변형이 작은 예산에서 τ를 약간 더 높게 유지할 수 있지만 MAE가 상당히 커진다. 선택기 비교에서는 straight-through 하드 Top-K가 밀집 Softmax 게이팅이나 DSelect-k보다 BFCL의 빡빡한 예산에서 강했고, 순전파가 항상 배포 예산과 정확히 일치한다는 장점이 있다. 예측 아키텍처는 은닉 차원 64·32의 비선형 MLP와 비교해 Kernel Ridge가 모든 미니셋 크기에서 더 낮은 평균 MAE와 더 높은 평균 τ를 보였다. BFCL에서 K를 20에서 500까지 늘린 실험에서는 K=80에서 상대 MAE 22.0% 감소로 격차가 가장 컸고, K=500 근처에서는 차이가 거의 사라졌다. 즉 과정 관계는 태스크가 아주 적을 때 가장 유용하다. 분석 섹션에서는 학습된 과정 가중치 γ가 벤치마크마다 다르게 나타나 결과-과정 균형을 벤치마크별로 적응시키는 근거를 보였고, BFCL 학습 에이전트 비율을 20%에서 100%까지 바꾼 실험에서 20%만으로도 SparseEval보다 낮은 MAE와 높은 τ를 유지했다. 학습 시간은 모든 벤치마크에서 약 4.2~8.3배 빨랐다. K=20, 40에서 선택된 미니셋은 모델별 실행 차이를 더 뚜렷하게 드러내는데, 예를 들어 Gemini 3.5 Flash는 Qwen 3.7 Max보다 도구 사용과 검증이 넓지만 스텝과 실패 호출 프로파일은 덜 favorable하다.

개발자 관점에서 이 논문이 유용한 지점은 압축 평가를 도입할 때 무엇을 기준으로 태스크를 고를지에 대한 구체적인 답을 준다는 것이다. 최종 점수 행렬만 보고 대표 태스크를 뽑는 방식은 에이전트에서는 서로 다른 행동을 같은 점수로 뭉갤 수 있으므로, 궤적에서 추출한 과정 통계를 함께 쓰면 더 적은 태스크로 전체 점수와 순위를 더 잘 복원할 수 있다는 것이 핵심 주장이다. 실무에서는 여섯 개 과정 지표를 자체 궤적 로그에서 자동 추출할 수 있는지, 그리고 학습된 γ가 우리 벤치마크에서 어떤 값을 갖는지(즉 과정 정보가 얼마나 기여하는지)를 먼저 확인하는 것이 좋다. 또한 이득이 대부분 K가 작을 때 나오고 K가 커지면 사라진다는 점, 예측기가 선형 커널 릿지로 제한된다는 점, 학습 에이전트와 평가 대상 에이전트의 분포가 크게 다르면 벤치마크 예측 성능이 떨어질 수 있다는 관련 연구 결과도 함께 고려해야 한다.

저자들이 밝힌 전제와 한계는 다음과 같다. 과정 표현은 벤치마크에 독립적으로 자동 추출 가능한 6차원으로 제한되며, 더 풍부한 과정 신호와 더 넓은 에이전트 벤치마크로 확장하는 것이 향후 과제로 남아 있다. 예측 헤드는 관측된 에이전트 구성 수가 태스크 수보다 훨씬 적다는 전제 위에서 선형 커널 릿지로 제한되며, 이는 용량 제한을 통한 안정성 확보를 위한 선택이다. 과정만 사용하는 변형이 특정 조건에서 순위 지표는 약간 더 좋지만 점수 오차가 커진다는 점도 결과의 균형이 절대적이지 않음을 보여준다. 또한 논문은 결과와 과정 관계를 융합하는 가중치 γ를 벤치마크별로 학습해야 하며, 그 값이 데이터셋마다 다르게 나타난다고 명시한다. 마지막으로 검증 라벨은 그래디언트에 참여하지 않고 학습 폴드에서 얻은 상태 중 하나를 고르는 데만 쓰이며, 테스트 에이전트는 최종 선택 후 정확히 한 번만 평가된다는 평가 프로토콜상의 전제가 있다.