도구 실패를 알아도 멈추지 않는 에이전트에 통합 단계를 강제한다
Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions
무엇인가
도구가 조용히 실패하는 상황을 다룬다. 검색 인덱스가 낡거나 리트리버가 주제를 벗어나면 에이전트는 여전히 텍스트를 받지만 그 텍스트는 더 이상 쓸모가 없다. 논문이 던지는 질문은 명확하다. 에이전트가 결과를 "무용하다"고 판단하는 능력과, 그 판단에 따라 소스를 떠나는 행동은 별개인가. 저자들은 판단·신념·행동을 분리해서 측정하지 않으면 성공률만으로는 무엇이 멈춤을 유발했는지 알 수 없다고 지적한다. 마감 시각에 멈추는 에이전트와 근거가 쌓여서 멈추는 에이전트는 조건이 바뀌기 전까지 같은 점수를 낼 수 있기 때문이다.
어떻게 동작하나
실험 환경은 HotpotQA distractor 개발 세트를 쓴다. 질문마다 10개 문단 지식베이스가 주어지고 그중 2개가 근거를 담고 있어서 각 검색 결과가 유용했는지 알 수 있다. 에이전트는 ReAct 형식으로 search, lookup, finish를 호출하고 예산은 8 액션, 정답 기준은 토큰 F1 0.6 이상이다. 실패는 다른 질문의 문단으로 관측값을 치환해 주입하며, clean, persistent, recover_after_c(c=1,2,3), late_onset_from_3의 여섯 체제를 동일 가중으로 평균낸 mean6를 쓴다. 판단은 에이전트가 보지 못하는 대화 복사본에 USEFUL/USELESS 한 단어를 묻는 사이드 채널로 매 스텝 수집하고, 신념은 계속 검색할 때와 지금 답할 때의 성공 확률 자기보고로 받는다. 핵심 지표는 시간을 맞춘 대조 Δ로, 지금까지 모든 결과를 무용하다고 판단한 이력에서 답할 확률에서 최신 결과만 무용하고 이전에 유용한 결과가 있었던 이력에서 답할 확률을 뺀 값이다. 3~6번째 결과 이후 결정에 대해 Mantel–Haenszel 위험차로 합산한다. Δ는 시간·마감 기반 정지에서 0, 무용 결과 누적에 반응하면 양수, 과거의 유용한 근거에 반응하면 음수가 된다.
무엇과 다른가
결과의 핵심은 판단과 행동의 해리다. 판단을 기록한 모든 모델은 실패한 소스의 결과를 97~100% 확률로 무용하다고 불렀고, Qwen3-8B가 자기 추론에서 진술한 판단도 사이드 채널과 87~96% 일치했다. 그런데 무용 판단이 5회 연속된 뒤에도 보조 장치 없는 Qwen3-8B는 292개 질문 중 1개에서만 답했고 나머지 모델은 최대 7%였다. 그 시점에 답했다면 15~17% 성공했지만 계속 검색했을 때는 최대 7%였다. 보조 장치 없는 모든 오픈 모델의 Δ는 음수였고, 이산시간 해저드 모델에서 무용 판단이 하나 늘 때마다 답할 확률은 −0.02~−0.01 변했으며 강제 규칙 아래에서는 +0.15~+0.17이었다. 자기 추론에 진술한 판단으로 Δ를 계산해도 여전히 0 미만이었고, 5회 연속 진술 후 답변률은 0~0.4%(Qwen3-32B는 6%)였다.
어떻게 쓰나
정보를 더 주는 것도 해결이 되지 않았다. 기억으로 답해도 된다는 허가는 Qwen3-8B를 일찍 멈추게 했지만 근거를 무시했고, 소스가 3회 실패 후 복구되는 질문의 55%에서 실제 결과가 나오기 전에 답했으며 Δ는 −0.32로 떨어졌다. 예산을 명시하면 7~8B 모델은 실패 소스 질문의 51~79%를 마지막 액션에서 답했고 Δ는 여전히 음수였다. 예산을 두 배로 늘리면 답변이 8번째에서 16번째 액션으로 밀리고 도구 호출이 약 두 배가 되지만 성공률 이득은 없었다. 규칙을 문장으로 적어주면 Llama-3.1-8B와 Qwen3-32B만 부분적으로 따랐고(Δ=+0.09, +0.08, 강제 시 +0.37, +0.33), 호출당 0.05 비용을 명시해도 7~8B 모델은 마감에 답했다. Claude Haiku 4.5는 비용을 명시하면 근거와 무관하게 거의 모든 질문에 답했고 성공률은 강제 규칙에 필적했다. 백업 도구를 추가해도 무용 결과가 쌓일수록 떠날 확률은 오르지 않았고(Δ≤+0.02), 무용 판단 5회 후 실패 도구를 비활성화하면 Δ가 +0.26, +0.30으로 바뀌었다. 판단과 누적 횟수를 매 스텝 문맥에 써넣은 decide 조건에서도 7~8B 세 모델의 Δ는 −0.14~−0.24였다.
전제와 한계
저자들이 제안하는 해법은 하네스가 통합 단계를 강제하는 것이다. 에이전트가 무용하다고 판단한 결과가 5회 연속되면 finish 액션만 남긴다. 이 규칙 아래 Δ는 +0.33~+0.40이었고, 오픈 모델 네 개와 Claude Haiku 4.5의 mean6가 +0.026~+0.097 올랐다(Holm 유의). 소스가 복구되거나 실패하지 않는 조건에서는 20개 검정 중 18개에서 비열등했고(마진 −0.05, Qwen3-8B가 두 번 근소하게 실패), 예산을 두 배로 늘려도 같은 액션에서 답했다. 무작위로 같은 빈도로 "무용"이라 말하는 신호와 비교하면 강제 규칙이 0.011~0.029 앞섰다. 예산 명시와 강제 규칙을 결합하면 14개 사전등록 검정 모두에서 두 구성요소 각각에 비열등했고, 조기 답변이 주 실패인 Qwen2.5-7B에서는 강제 규칙보다 +0.138 높았다. 사후에 고른 최적 고정 상한·런길이 정책과 비교하면 보조 장치 없는 에이전트는 6~13점 손해였고, 예산을 두 배로 늘린 Qwen 7~8B는 이득 없이 호출을 61~71% 더 했다. 강제 규칙은 질문당 3~5회 판단 호출을 유발하는데, 이는 에이전트 사고에서 키워드 리더로 판단을 읽어 대체할 수 있고 Llama-3.1-8B와 Qwen3 모델에서 성공률 차이를 0.01 이내로 유지한다.
사전등록 재현도 통과했다. 이전 결과를 본 뒤 정의된 Δ를 새 질문 300개에서 주 지표로 등록해 19개 검정 전부 통과했고, 보조 장치 없는 모델과 예산 명시 모델의 Δ는 0 미만, 강제 규칙은 +0.30~+0.35였으며 mean6에서 +0.030~+0.061 앞섰다. FEVER 292개 균형 주장에서는 효과가 더 컸다(강제 규칙 mean6 +0.129~+0.201). 주제가 맞지만 무용한 실패(plausible 84~97%, answerless 76~97% 무용 판정)에서도 해리는 유지됐다. 더 큰 모델도 크게 다르지 않다. Qwen3-32B는 무용 판단 5회 후 284개 중 19개에서만 답했고, Claude Sonnet 5만 보조 장치 없이 부분적으로 근거를 따랐다(설계 라벨 대조 +0.12). PPO로 검색을 학습한 Search-R1은 실패 소스 질문의 27%에서 기억으로 답했지만 45%는 예산 끝까지 검색했고, 같은 스텝에서 더 긴 실패 이력 뒤에 더 자주 답하지 않았다(−0.03). 추론 모드의 Qwen3-32B는 실패 소스 질문의 97%에서 기억으로 답했고(비추론 시 11%), 소스가 2회 실패 후 복구되는 질문의 47%에서 실제 결과 전에 답했다.
실무적으로 중요한 지점은 프롬프트로 통합을 대신할 수 없다는 것이다. 예산이나 마감이 알려져 있고 호출이 무료라면 마감에 답하는 것이 성공률을 떨어뜨리지 않지만, 모든 호출을 소진하고 예산이 바뀔 때마다 정지점이 이동한다. 따라서 실패한 소스를 버리는 결정은 프롬프트에 맡기지 말고 하네스에 명시적 단계로 넣어야 한다. 또한 평가에서 성공률만 보고 근거 기반 정지를 추론해서는 안 된다. 마감도 같은 성공률을 내기 때문이다. 대신 같은 스텝에서 에이전트가 무용하다고 판단한 결과의 연속 길이가 늘수록 정지 확률이 오르는지를 측정해야 하고, 판단과 행동은 분리해서 기록해야 한다.
저자들이 밝힌 한계도 분명하다. 실패를 고정된 지식베이스의 관측값 치환으로 시뮬레이션했기 때문에, 부분적이거나 낡았거나 틀린 내용을 반환하는 실제 도구 실패에서도 같은 패턴이 성립하는지는 검증되지 않았다. 소스는 최대 3회 실패 후 복구되도록 설정했고 규칙의 임계값도 그 분포에 맞춰 골랐기 때문에, 복구가 더 늦게 오면 규칙이 회복 직전에 포기할 수 있어 실제 소스에서는 임계값 조정이 필요하다. 대부분의 통제 실험은 오픈 모델에서 돌았고 Claude 두 모델은 조건과 질문 수가 더 적었다. 판단은 대화 복사본에서 유도하고 신념은 자기보고이므로 모델 내부 비교로만 해석해야 한다. 진술된 판단은 독립적인 사람이 아니라 LLM 주석자 두 명과 저자 adjudication으로 라벨링했다. 기억으로 답하는 것이 자동으로 안전하지도 않다. 따라서 이 결과는 도구를 버리자는 주장이 아니라, 소스를 포기하는 결정을 명시적으로 만들고 평가하자는 주장이다.