실패한 LLM 에이전트 롤아웃 5만 건을 진단과 수정안으로 바꿔 재학습에 쓴다

Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training

HF Daily2609.40111

Kunlun Zhu, Xuyan Ye, Yibo Li2026-09-30

무엇인가

LLM 에이전트의 실패한 롤아웃은 최종 보상보다 많은 정보를 담고 있다. 에이전트가 본 관측, 고른 행동, 환경의 응답이 모두 남아 있지만, 보상만으로는 어느 결정을 고쳐야 하는지, 무엇으로 대체해야 하는지는 알 수 없다. 기존 연구는 실패 모드 분류(MAST), 책임 에이전트와 결정적 오류 단계 식별(Who&When), 진단 모델 학습(AgenTracer), 교정 피드백 기반 복구(AgentDebug)로 이 문제에 접근해 왔다. 그러나 실행 설정과 주석 대상, 교정 근거가 제각각이라 공통된 실패 모음 위에서 진단과 행동 학습을 함께 연구하기 어려웠다. 이 논문은 그 간극을 메우는 데이터셋과 파이프라인을 제안한다.

어떻게 동작하나

제안하는 Agent Error Dataset(AED)은 33개 환경, 19개 harness 계열, 23개 정책 모델에서 수집한 9,961개 소스 태스크로부터 만든 50,228개 오류-진단 쌍이다. 38,278개의 소스 트레이스 blob이 저장되어 있고 blob당 평균 1.31쌍이 붙는다. 실패는 환경 어댑터가 허용 예산 안에서 비성공 종료를 보고한 실행으로 정의하며, 하나의 레코드는 실패한 행동-관측 트레이스, 진단 하나, 제안된 수정, 검토 결정, 가능한 리플레이 분기를 연결한다. 진단은 고정된 오류 택소노미에 배정하는 방식이 아니라 자유 텍스트이고, 오류 모드는 나중에 사후 유도한다. 실험에 쓰인 별도의 동결 진단 릴리스는 15개 환경, 2,309개 소스 태스크에 걸친 4,319개 행이다.

무엇과 다른가

핵심은 5단계 Agentic Error-to-Training(AET) 파이프라인이다. 1단계에서 환경·harness·정책 전반의 자연 실패를 모으고 인프라나 채점기 결함을 걸러낸다. 2단계에서 오류 위치와 책임 에이전트를 특정하고 트레이스를 인용한 설명과 수정안을 생성한다. 3단계에서 구조적·의미적 검사를 통해 진단을 학생이 볼 수 있는 트레이스에 접지시키고 채택·기각된 제안을 기록한다. 4단계는 리플레이가 지원되는 경우로, 같은 체크포인트에서 정책·harness·예산·검증기 설정을 맞춘 새 원래 행동 재시도와 수정안을 비교한다. 두 결과를 모두 보존하며, 복구는 그 조건에서의 수정을 지지할 뿐 유일한 근본 원인을 확립하지는 않는다. 5단계에서 진단 SFT, 복구 SFT, 행동 선호라는 목적별 학습 뷰를 만든다. 진단 레코드는 리플레이가 필요 없고, 복구 타깃은 실행되어 통과한 continuation이 필요하며, 선호 쌍은 같은 상태에서 실행된 대안과 양의 결과 대비가 필요하다.

어떻게 쓰나

학습 뷰의 구성도 구체적이다. 진단 뷰는 실패 트레이스를 입력으로, 귀속된 단계·책임 에이전트·근거 있는 설명·제안 수정을 타깃으로 삼는다. 입력에서 구성 전용 검증기 컨텍스트, 성공 참조, 리플레이 결과는 제외한다. 예방 및 복구 뷰는 오류 이전 이력과 실행된 통과 행동을 짝지으며, post-error 변형은 원래의 잘못된 행동과 그 거부를 마스킹된 컨텍스트로 추가한 뒤 수정을 감독한다. 손실은 타깃 어시스턴트 토큰에만 걸리고 컨텍스트와 도구 관측에는 걸리지 않는다. 진단은 예제별 평균으로, actor는 모든 랭크와 누적 스텝에 걸친 토큰 합으로 정규화한다. 오프라인 action-DPO 파일럿은 복구 이득을 확인하지 못했다.

전제와 한계

수치 결과는 이렇다. 3,062개 matched replay 쌍에서 첫 제안 수정은 검증기 통과율을 18.4%에서 51.1%로 끌어올려 32.7%포인트 이득을 냈다(태스크 클러스터 95% 구간 28.4~37.0). 반복 제안 중 선택은 하지 않았다. citation-first judge는 공통 실패 풀의 93.5%에 대해 트레이스 인용 진단을 생성했고, 비교 대상 대안들은 48.4~65.8%였다. 이는 생산 수율이지 독립적 라벨 정확도는 아니다. 위치를 제공한 별도 연구에서는 진단 유도 continuation이 31.3%로 일반적 재고(26.0%)와 리플레이(18.6%)를 앞섰지만, 일반 재고 대비 짝지은 이득은 불확실하다고 저자들은 밝힌다.

진단 학습에서는 동결 릴리스로 1,656개 소스 태스크에 전체 진단 SFT를 적용해 Qwen3-8B의 내부 교사 라벨 대비 exact-step 일치도를 47.2%에서 63.6%로 올렸다(943개 홀드아웃, 3개 시드 평균). 이 비교에서 가장 강한 프롬프트 참조는 54.7%였고, 네 개의 증가하는 학습셋 크기 각각에서 평균 일치도가 향상됐다. 그러나 공개 벤치마크 전이는 프로토콜에 따라 갈린다. 1,656 태스크 arm의 세 시드는 통합 프로토콜에서 Who&When 기준 베이스를 앞섰지만 학습과 겹치는 태스크를 제외하면 구간이 0을 포함하고, TrajErrBench 평균 정확도는 베이스 미만으로 남는다. 948 태스크·시드 17 학생을 다른 공개 프로토콜로 시험한 표에서는 전체 진단 학습이 Who&When의 책임 에이전트 정확도와 exact-step 정확도를 모두 잃었고, 답변 형식 continuation이 결손 일부를 회복했다. 같은 동결 케이스와 first-call 계약에서는 답변 형식 학생이 손으로 만든 두 조건에서 네 개의 프롬프트 기반 프런티어 참조를 앞섰지만 알고리즘 생성 조건, exact step, AgentErrorBench에서는 앞서지 못했다. 동일 베이스·동일 소스 태스크 수로 비교한 자원 대조에서는 AED와 AgenTracer 데이터가 각각 다른 테스트 분포에서 앞섰고, AgenTracer의 최대 이점은 주입된 오류에서 나타났다.

행동 정책 학습에서는 action-only repair 학습이 WebShop-lite에서 success-only 학습보다 6.67%포인트 높았다. 수정을 포함한 레시피들은 WebShop-lite에서 높고 TextQuest에서 낮았으며, WebShop 이득과 TextQuest 손실은 사후 다중성 보정을 통과했다. reflection은 action-only 타깃 대비 감지된 이득이 없었다. 실제 ALFWorld와 ScienceWorld에서는 예방 arm이 학습되지 않은 정책에 패배했고, 이 실제 환경 비교는 그 레시피에만 존재한다.

저자들이 명시한 한계는 분명하다. actor 레시피 비교는 단일 시드이고 태스크 풀, 노출, 옵티마이저 업데이트 수가 달라 수정 감독 자체가 아니라 결합된 레시피를 측정한다. 컬렉션 멤버십은 학습 자격이나 검증된 수리를 의미하지 않는다. 리플레이 복구는 해당 조건에서 수정이 통했다는 것일 뿐 유일한 근본 원인을 확립하지 않는다. 학습과 홀드아웃은 환경과 다수의 harness-정책 조합을 공유하며, 과거 감독 데이터는 정책 컨텍스트를 생략해 이후 검사로 소급 검증되지 않았다. 교정 유용성, 라벨 타당성, 학습된 복구는 각각 별도의 근거가 필요하다고 저자들은 강조한다. 또한 SWE-bench 같은 저장소 기반 태스크는 기여자 이름이나 이메일이 코드 주석과 이슈에 노출될 수 있어, 데이터 공개 시 소스별 프라이버시 검토와 라이선스 제약, 민감 정보 삭제를 거친다고 밝힌다.