EviSkill이 LLM 에이전트 스킬 수정을 실행 재현으로 검증한다

EVISKILL: Grounding Skill Evolution in Replayable Evidence

HF Daily2610.05030

Yan Zhou, Yili Wang, Yiwei Dai2026-10-04

무엇인가

LLM 에이전트가 도구 사용, 웹 내비게이션, 장기 의사결정 같은 상호작용 과제를 풀 때 재사용 가능한 절차 지식(스킬)은 모델 파라미터를 건드리지 않고 성능을 올리는 수단이다. 문제는 이 스킬을 계속 갱신하는 과정이다. 기존 경험 기반 방법들은 실행 궤적에서 교훈을 뽑아 스킬을 고치지만, 그 수정을 정당화한 행동 증거와 과제 맥락을 잃어버린다. 또 검증셋 성능으로 개정 전체를 통째로 채택하거나 버리기 때문에, 국소적으로는 옳은 수정이 함께 탈락하거나 반대로 해로운 수정이 함께 채택된다. 논문은 이 두 지점을 정면으로 겨냥한다.

어떻게 동작하나

EviSkill의 핵심 자료구조는 재현 가능한 증거 카드(Replayable Evidence Card)다. 카드는 식별자 i, 궤적에서 잘라낸 트리거 구간 집합 G_i, 제안된 수정 d_i로 구성된다. 트리거 구간은 과제 x, 출처 에포크, 궤적 내 시작·끝 스텝을 담아 나중에 그 실행 상태를 그대로 복원할 수 있게 한다. 에포크마다 검증된 스킬 S_V와 아직 승격되지 않은 잠정 수정 원장 P를 합쳐 작업 스킬 S_W를 만들고, 이 스킬로 훈련 과제를 수행해 궤적을 모은다. 추출기는 현재 궤적에서 궤적 증거 카드를, 인접 에포크의 궤적 쌍 비교에서 대조 증거 카드를 뽑아 증거 풀에 쌓는다. 호환되는 카드들을 증거 윈도로 묶어 편집기가 후보 수정 집합을 만들고, 각 수정은 자신을 지지하는 카드들과 영구 식별자로 연결된 채 남는다.

무엇과 다른가

다음 단계는 재현 기반 검증이다. 후보 수정마다 연결된 카드의 트리거 구간을 따라가, 해당 스텝 직전까지의 실행 상태와 상호작용 이력을 복원한 뒤 수정을 적용한 스킬로 그 구간을 다시 실행한다. 원본 구간과 재현 구간을 비교해 평가기가 수용, 재고, 기각 중 하나를 내리고 피드백을 붙인다. 재고 판정이면 편집기가 수정을 고쳐 다시 재현·평가한다. 여기서 살아남은 수정만 모아 후보 개정을 만들고 검증셋 성능으로 전역 채택 여부를 정한다. 개정이 기각되면 버리지 않고, 잠정 수정을 걷어낸 검증 스킬 위에서 각 수정을 다시 재현해 국소적으로 지지되는 것만 원장에 남긴다. 카드도 생명주기를 갖는다. 잠정 수정을 지지하는 카드는 보호되어 새 편집 윈도에서 빠지되 비교용 참조는 유지되고, 채택된 수정의 카드는 보관되며, 반복 기각된 카드는 만료 처리된다. 최종 추론에는 마지막 검증 스킬만 고정되고 승격되지 않은 잠정 수정은 제외된다.

어떻게 쓰나

실험은 AppWorld, ScienceWorld, ALFWorld 세 대화형 벤치마크에서 GPT-5.5, GPT-5.4, GPT-5.4-mini, Qwen3.6-35B-A3B, Qwen3.5-9B, Qwen3.5-4B 여섯 백본으로 수행됐다. 비교 대상은 스킬을 쓰지 않는 NoSkill, 고정된 초기 LLM 생성 스킬, 그리고 Trace2Skill, EvoSkill, SkillGrad, SkillOpt 네 가지 스킬 진화 기법이다. EviSkill은 18개 모델-데이터셋 조합 중 14개에서 최고 정확도를, 16개에서 상위 2위를 기록했고 NoSkill 대비 평균 17.93%포인트 향상됐다. ScienceWorld에서는 Qwen3.5-9B로 최강 베이스라인을 15.64%포인트, GPT-5.4로 10.43%포인트 앞섰다. 같은 ScienceWorld에서 GPT-5.5 기준 초기 스킬이 76.78%인데 Trace2Skill 65.40%, EvoSkill 54.50%, SkillGrad 67.30%로 오히려 퇴행한 반면 EviSkill은 83.41%를 냈다. 초기 스킬 대비로는 17개 설정에서 개선, 나머지 1개에서 동률이었다.

전제와 한계

구성 요소별 기여도도 수치로 제시된다. 재현 검증을 제거하면 ALFWorld 2.49, AppWorld 4.56, ScienceWorld 2.85%포인트가 각각 떨어졌고, 교차 에포크 전파를 끄면 AppWorld가 89.68%에서 85.52%로 하락했다. 메커니즘 분석에서 훈련 궤적에 근거한 후보 수정조차 첫 재현에서 ALFWorld 20.7%, AppWorld 41.8%, ScienceWorld 42.5%가 재고 또는 기각 판정을 받았다. 재고로 분류된 수정은 피드백 기반 수정을 거쳐 AppWorld 16개 중 13개, ScienceWorld 54개 중 49개, ALFWorld 1개 중 1개가 회복됐다. 전역 기각 후 잠정 보류된 수정 96개를 추적한 결과 46.9%가 한 에포크 뒤, 14.6%가 두 에포크 뒤, 11.5%가 세 에포크 뒤 검증 스킬에 편입되어 총 72.9%가 결국 채택됐다. 증거 카드의 23.0%는 서로 다른 두 에포크 이상에서 편집 윈도로 선택됐다.

실무적으로 이 논문이 주는 신호는 명확하다. 실패 궤적을 요약해 스킬 문서를 고치는 파이프라인을 만들 때, 수정안과 그 근거가 된 실행 구간을 식별자로 묶어 두고 실제로 그 구간을 다시 돌려 행동 변화를 확인하는 단계를 넣어야 한다는 것이다. 또 개정 단위를 통째로 채택·폐기하지 말고, 전역 지표가 나빠졌더라도 국소적으로 지지되는 수정은 별도 원장에 남겨 다음 라운드에서 다시 판정하는 구조가 유효하다는 근거를 제공한다. 증거 카드의 보호·보관·만료 상태 관리와 재현 비용(트리거 구간마다 실행 상태 복원과 재실행)이 실제 시스템에서는 가장 큰 엔지니어링 부담이 될 것이다.

저자들이 명시한 전제와 한계도 분명하다. 실험은 4 에포크 예산으로 돌았고, 그 시점에 잠정 보류 수정의 27.1%는 여전히 승격되지 않은 채 남아 있어 최종 편입 여부가 관측되지 않았다. 승격되지 않은 잠정 수정은 최종 스킬에서 제외되고 추가 진화를 유발하지 않는다. 또 AppWorld에서는 다른 기법 대비 우위가 상대적으로 일관되지 않았으며, 재현 검증의 이득은 재실행 비용을 전제로 한다. 논문은 재현 실패 판정이 국소 재현 기준의 수용일 뿐 전역 개정 채택을 뜻하지 않는다는 점도 명시한다.