장기 자율 에이전트가 내린 중요한 결정을 증거 그래프로 감시한다

What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents

HF Daily2610.06406

Zhongxiang Sun, Jiahao Yan, Hongkang Zhao2026-10-05

무엇인가

이 논문은 장기 자율 에이전트가 저장소 수정, 연구 재현, 데이터 분석 같은 긴 작업을 수행할 때 사용자가 개별 결정을 내리는 대신 감독자 역할로 이동한다는 문제를 다룬다. 에이전트 활동량과 근거 파편화 때문에 어떤 결정을 사용자가 검증해야 하는지 판단하기 어렵고, 저자들은 상황 인식이 요구된다고 본다. 즉 실행과 요구사항의 정렬, 그리고 검증이 필요한 중요한 자율 결정에 대한 인식이 필요하다. 예를 들어 평가 기준을 바꾸면 연구 결론이 달라질 수 있고, 불완전 레코드를 버리면 분석 대상 모집단이 달라질 수 있다. 이런 선택은 합리적일 수 있지만 사용자 판단이 필요하며, 근거는 메시지, 도구 결과, 중간 산출물에 흩어져 있다. 논문은 어떤 결정이 검증 대상인지 찾고 그 함의를 이해할 근거를 연결하는 모니터를 연구한다.

어떻게 동작하나

이를 평가하기 위해 AgentMonBench라는 소프트웨어 엔지니어링 벤치마크를 제안한다. 세 하위 집합은 요구사항과 행동의 정렬, 그리고 검증이 필요한 중요한 자율 결정에 대한 인식이라는 두 축을 다룬다. SpecGAP은 DeNovoSWE 과제 문서에서 핵심 조건을 의도적으로 제거해, 저장소에는 구현됐지만 문서에는 명시되지 않은 중요 행동이나 제약을 모니터가 찾는지 시험한다. SilentSwap은 과제 문서는 그대로 두고 저장소에 다섯 개의 의미적 치환을 넣어, 기존 테스트는 통과하지만 문서화된 행동과 달라진 구현을 찾는지 시험한다. FeedbackTrace는 SWE-chat의 실제 상호작용에서 세션당 최대 하나의 사용자 피드백 사건을 사용하며, 모니터는 피드백 이전 상호작용 이력만 보고 검증 지점을 찾아야 한다. 정답 주석에는 검증 지점, 영향, 사용자 확인이 필요한 선택, 최소 충분 근거 단위, 중요도 라벨이 포함된다. 품질 검사에서 SpecGAP은 484개 조건 중 447개(92.4%), SilentSwap은 500개 치환 중 468개(93.6%), FeedbackTrace는 100개 세션 중 93개(93.0%)에서 최종 합의를 얻었다.

무엇과 다른가

제안 방법인 Evidence-Grounded Behavior Graph(EBG)는 추가 학습 없이 동작한다. 입력은 에이전트가 볼 수 있는 컨텍스트 X와 그 안의 과제 요구사항 Q이며, 입력 유형은 저장소 또는 실행 궤적이다. 그래프 빌더 Fτ가 X를 증거 E, 행동 B, 범위 S, 명시적 관계 R로 구성된 그래프 G로 바꾼다. 증거 추출은 식별자, 원문 내용, 출처 위치를 보존해 여러 행동이 같은 출처 단위를 참조할 수 있게 한다. 행동 형성은 저장소에서는 조건-연산-결과, 실행 궤적에서는 요구-행동-응답 구조를 따른다. 그래프 조직은 관련 행동을 행동 범위로 묶고, 증거로 뒷받침되는 방향성 관계 간선으로 범위 사이를 연결한다. 이 세 단계는 결정적이며 LLM 호출 없이 보이는 컨텍스트만 사용한다. 이후 발표자 Pτ가 그래프를 과제 지향 증거 뷰 V로 바꾸고, 모니터 M이 Q와 V를 사용해 발견 Yhat을 낸다. 전체 파이프라인은 G=Fτ(X), V=Pτ(G,Q), Yhat=M(Q,V)로 요약된다.

어떻게 쓰나

과제 지향 증거 제시는 입력 유형에 따라 달라진다. 저장소에서는 과제 요구사항 Q가 디렉터리 순위를 정하고 모니터가 검사할 파일을 고른다. 선택된 파일 안에서 과제 문서와 직접 맞는 범위가 시드가 되고, 각 시드의 모든 인접 간선과 반대 끝점을 보존해 1홉 부분 그래프를 만든다. 그다음 연결 요소로 나누고 각 요소에서 하나의 시드를 읽기 루트로 선택하며, 결과 뷰는 구성 요소와 일치하는 문서 구절 및 소스 코드를 결합한다. 실행 궤적에서는 행동을 Task Scope별로 묶고 각 범위 안에서 원래 순서를 유지한다. 마지막으로 보이는 행동의 범위는 Current, 나머지는 History로 표시하며 각 행동의 증거와 궤적 위치를 보존해 과제 진행을 추적 가능하게 한다. 모니터는 이 뷰를 요구사항과 비교해 검증이 필요한 중요한 결정을 찾고, 발견을 원문 출처까지 추적 가능한 근거에 묶는다.

전제와 한계

실험은 다섯 계열 여덟 모델로 수행했다. GPT-5.6 Luna, GPT-5.6 Terra, GPT-5.6 Sol, DeepSeek-V4.1-Flash, DeepSeek-V4-Pro, Kimi K3, Claude Sonnet 5, GLM-5.3이다. 베이스라인은 저장소 내용이나 원래 실행 추적을 그대로 주는 Base이며, SpecGAP과 SilentSwap에서는 지역 코드 부분 그래프를 검색하는 RepoGraph 적응판도 비교한다. 규칙 기반 지표는 SpecGAP의 Localization F1, SilentSwap의 Localization Score, FeedbackTrace의 Evidence Hit Rate이고, LLM 판정 지표는 SpecGAP의 Semantic F1과 Question Quality, SilentSwap의 Localization Correctness와 Change Correctness, FeedbackTrace의 Verification Point Alignment와 Evidence Support Score이다. GLM-5.2와 Qwen3.7-Max가 여섯 의미 지표를 독립 평가하고 산술 평균을 보고한다. 본문에 전사된 Table 1의 모델별 개별 수치는 없지만, 저자들은 현재 LLM이 중요한 결정 감시에 여전히 한계가 크고, EBG가 대부분 설정에서 Base보다 결정 식별과 근거 위치화를 개선하며 저장소 비교의 대부분에서 RepoGraph보다 높은 점수를 낸다고 보고한다. 다만 개선 폭은 모니터와 과제에 따라 달라지고, 근거 검색이 좋아져도 결정 해석은 약할 수 있어 둘은 구분된다고 강조한다.

입력 크기 분석에서 Base 평균 점수는 입력이 커질수록 하락했다. FeedbackTrace의 Evidence Hit Rate는 0.667에서 0.422로, SilentSwap의 Localization Score는 0.557에서 0.429로 떨어졌고 SpecGAP의 Localization F1은 더 완만하게 감소했다. EBG는 모든 입력 규모에서 평균 위치화를 개선했고 아홉 개 평균 비교가 모두 EBG에 유리했다. High 그룹에서 절대 개선폭은 SpecGAP Localization F1 0.078, SilentSwap Localization Score 0.115, FeedbackTrace Evidence Hit Rate 0.108이었다. 실제 적용으로 EBG를 Codex Harness에 훅, 스킬, 도구로 통합했다. 훅은 리뷰를 촉발하고 스킬은 리뷰 기준을 정의하며 도구는 EBG로 근거를 검색하고 발견을 기록한다. 리뷰는 계획이나 사용자 프롬프트에 명시되지 않은 선택을 점검하는 모호성 리뷰, 계획 변경에 추가 검증·공개·승인이 필요한지 보는 조정 리뷰, 증거가 제안 결론을 뒷받침하는지 보는 결과 리뷰로 나뉜다. autoresearch와 관련 자율 에이전트 워크플로에서 가져온 다섯 연구 과제에 적용했을 때, 하네스 없는 Codex는 핵심 쟁점을 공개하지 않았지만 하네스가 있으면 식별해 공개했다.

한국 개발자에게 이 논문은 장시간 도는 코딩 에이전트를 받아들일 때 무엇을 검토해야 하는지 구조를 제공한다. 저장소를 고치는 에이전트, 데이터 분석이나 연구 재현을 자율 수행하는 에이전트에서 요구사항에서 빠진 조건, 테스트를 통과하지만 의미가 바뀐 구현, 나중에 사용자 피드백으로 문제가 드러나는 자율 선택을 확인하는 데 쓸 수 있다. EBG는 근거를 행동 단위로 묶고 출처 추적을 가능하게 하지만 의미 판단 자체를 대신하지는 않는다. 따라서 실무에서는 근거 검색 성능만 보지 말고, 모니터가 결정의 의미와 결과를 제대로 해석하는지, 그리고 발견이 원문 문서와 코드까지 추적되는지 함께 확인해야 한다. 리뷰 하네스 형태로 에이전트 실행 중간에 삽입해 사용자 승인 지점을 만드는 방식이 현실적인 적용 예다.

저자들이 밝힌 한계와 전제도 분명하다. 현재 LLM은 중요한 결정 감시에 여전히 개선 여지가 크고, EBG의 이득은 모니터와 과제에 따라 달라진다. 근거 검색과 결정 이해는 별개라서 근거를 잘 찾아도 해석이 틀릴 수 있다. EBG 자체는 학습이 필요 없고 그래프 구성과 제시가 결정적이지만, 최종 의미 판단은 모니터 모델이 한다. 벤치마크는 소프트웨어 엔지니어링에 한정되며 FeedbackTrace는 Python SWE-chat 세션, 세션당 최대 하나의 피드백 사건으로 제한된다. SpecGAP과 SilentSwap은 DeNovoSWE에 기반하고, 품질 검사 합의율도 100%가 아니다. 실제 적용 사례는 다섯 연구 과제로 제한적이어서 소프트웨어 엔지니어링 밖 일반화는 입증되지 않았다. 저자들은 의도된 연구 용도에서 중대한 윤리적 위험은 예상하지 않지만, 원본 데이터 접근과 재사용은 원 데이터셋의 조건과 라이선스를 따른다고 밝힌다.