Adaptive Consistency Graph가 장기 실행 에이전트 표류를 줄인다

Adaptive Consistency Graph for Long-Horizon Agents

HF Daily2609.32754

Jiecong Wang, Hao Peng, Zhanyi Wang2026-09-26조회 3

무엇인가

LLM 에이전트는 짧은 과제에서는 그럴듯한 국소 결정을 내리지만, 성공이 의존적인 행동과 도구 호출의 긴 연쇄를 요구하는 순간 성능이 떨어진다. 실행이 길어지면서 과제 요구사항, 과거에 수집한 근거, 현재 실행 상태가 서로 분리되고, 이후 결정이 원래 목표에서 표류한다는 것이 이 논문이 다루는 문제다. 기존 에이전트 메모리 연구들은 지속성, 성찰, 재사용 가능한 추상화에 초점을 맞춰 왔다. 하지만 생성된 요약은 프롬프트 길이를 줄이는 대신, 그 사실이 왜 기록되었는지 복원하는 데 필요한 국소 이벤트와 출처를 버릴 수 있다. 긴 문맥 연구에서도 정보가 문맥 창 안에 들어가더라도 위치에 따라 사용이 어려워질 수 있다는 결과가 있었다.

어떻게 동작하나

Adaptive Consistency Graph(ACG)는 실행 중 관찰과 명시적 상태 기록을 메모리 단위로 분해해 영구 그래프에 축적한다. 각 단위는 식별자, 내용, 유형, 출처 참조, 관측된 발생들, 객체 식별자·속성 같은 구조화 필드로 구성된다. 같은 내용이 반복되면 단위를 공유하되 발생은 병합하지 않는다. 발생은 생성 이벤트, 행동, 관찰, 출처, 시간 순서를 기록하며, 출처 링크는 그 기록이 어디서 왔는지를 가리킬 뿐 진실이나 과제 완료를 보증하지 않는다.

무엇과 다른가

검색은 원래 과제와 최신 상호작용 두 가지로 시드한다. 과제 시드 목록과 이벤트 시드 목록을 라운드로빈으로 교차해 고유 시드를 뽑고, 그래프상 거리 d 이내의 이웃과 지역 클러스터를 더해 후보 집합을 만든다. 그래프는 임베딩 공간에서 상호 최근접 이웃인 단위를 연결하고, 같은 출처에서 나온 단위에는 출처 친화 가중치를 준 뒤 구조 엔트로피 기반 조직기로 지역 클러스터를 묶는다. 요구사항은 정확한 지시문 스팬으로 표현되고, 귀속은 개별 행동이나 도구 호출 발생 수준에서 추적된다. 모호하거나 누락된 귀속은 의미 유사도로 채우지 않고 미할당으로 남긴다. 요구사항별로 출처 자격을 통과한 후보 중 과거 단위는 요구사항 텍스트와의 임베딩 유사도로 최대 8개를 뽑고, 현재 이벤트 단위는 별도로 보존한다. 이렇게 만들어진 요구사항-근거 대응은 임시 투영이며 영구 그래프에 기록되지 않는다.

어떻게 쓰나

렌더러는 멤버십, 현재 이벤트, 근거, 상호 참조 블록 순으로 전체 렌더 결과가 남은 토큰 예산 안에 들어갈 때만 블록을 채택한다. 예산이 빠듯하면 요구사항-근거 연관의 표현을 줄이고 현재 이벤트 근거를 우선하며, 여러 요구사항이 공유하는 근거는 한 번만 펼치고 나머지는 참조로 처리한다. 뷰에서 빠진 기록은 영구 메모리에 남아 이후 결정에서 다시 검색될 수 있다. 중요한 점은 ACG가 기반 에이전트의 플래너나 도구 실행기를 대체하지 않고, 읽기 전용의 구조화된 문맥 뷰만 제공한다는 것이다.

전제와 한계

실험은 DeepPlanning(360개), BrowseComp-Plus(830개), SWE-bench Lite(300개) 고정 과제 집합에서 수행됐다. 베이스라인은 ReAct, COMPASS, TDP*, CUGA, ACON이고 모델은 GPT-5.6-luna와 DeepSeek-v4-flash, 과제당 외부 행동 100회, 실행기 출력 4,096토큰 한도다. GPT-5.6-luna에서 ACG는 BrowseComp-Plus 73.5%(ReAct 62.4%), SWE-bench Lite 64.7%, DeepPlanning 12.4%를 기록했고, DeepSeek-v4-flash에서는 각각 62.7%, 63.3%, 11.7%였다. 등가중 평균은 Luna ACG 50.2%, DeepSeek ACG 45.9%로, 6개 모델-벤치마크 조합 중 5개에서 1위, 나머지 1개에서 2위였다. ReAct는 5개 설정에서 가장 강한 베이스라인이었고, DeepSeek의 DeepPlanning에서는 COMPASS가 베이스라인 중 앞섰다.

과제 구조별로는 SWE-bench Lite에서 DeepSeek ACG가 한 헝크 수정 71.6%, 세 헝크 수정 48.6%로 ReAct의 65.3%, 37.8%를 앞섰다. 실행 길이와 결과의 관계도 보고된다. DeepSeek ReAct의 BrowseComp-Plus에서 1~20 행동으로 끝난 과제는 287개 중 279개(97.2%)가 성공했지만 61~100 행동 구간은 170개 중 24개(14.1%)만 성공했다. SWE-bench Lite에서는 39/46(84.8%)과 34/98(34.7%)이었다. ACG도 같은 경향을 보였지만(88.7%에서 6.9%로 하락), SWE-bench Lite의 61~100 행동 구간에서는 ACG가 50.0%를 유지해 ReAct의 34.7%보다 높았다. 비용 측면에서는 GPT-5.6-luna의 SWE-bench Lite 중앙 호출 수가 ReAct 15, COMPASS 60, TDP* 86, CUGA 30.5인데 성공률은 60.3%, 12.7%, 22.3%, 3.7%로 호출 수가 성공을 보장하지 않았다. TDP*는 ReAct의 약 5.7배 호출, 중앙 토큰 기준 1.075M 대 0.128M으로 약 8.4배를 썼다. Luna ACG는 중앙 29회 호출로 ReAct 15회보다 많으면서 성공률을 60.3%에서 64.7%로 올렸고, DeepSeek에서는 47회 대 44회로 63.3% 대 56.7%였다. 반대로 BrowseComp-Plus의 DeepSeek ACG는 중앙 호출이 21회로 ReAct 30회보다 적었지만 성공률은 62.7% 대 68.2%로 낮았다.

실패 진단도 제시된다. SWE-bench Lite의 DeepSeek 실패 과제에서 반복 실행 비율은 ACG 8.2%로 COMPASS 27.9%, TDP* 96.4%, CUGA 64.9%, ACON 24.8%보다 낮았고 ReAct 6.2%보다는 약간 높았다. Luna에서는 ACG와 ReAct 모두 0.0%였다. 산출물 누락 비율은 DeepSeek ACG 0.9%로 ReAct 26.2%, COMPASS 94.1%, TDP* 78.4%, CUGA 71.3%, ACON 76.2%와 큰 차이를 보였다. 다만 ACG와 ReAct 모두 실패 과제군에서 거부 에피소드 이후 100.0% 실행을 재개했음에도 최종적으로 실패했다.

저자들은 개선이 균일하지 않다고 명시한다. DeepPlanning 성공률 12.4%와 11.7%는 제약된 계획이 여전히 어렵다는 것을 보여주며, 등가중 평균은 세 벤치마크를 요약한 값일 뿐 통합 추정치로 읽어서는 안 된다고 밝힌다. 또한 관찰된 상관들은 상태 불일치가 실패의 원인임을 규명하지 않으며, 성공률 향상을 그래프 검색, 출처 자격 검증, 렌더링 같은 개별 메모리 메커니즘의 기여로 분리하지도 못한다. 실행 길이별 비교는 서로 다른 궤적 그룹의 조건부 비교이지 매칭된 과제 추정이 아니고, 행동 한도를 바꾸면 성공이 오른다는 것을 입증하지도 않는다.