에이전트 파이프라인 결함 복구는 원문 재유도 가능성이 결정한다
Re-derivability Decides What a Staged Agent Pipeline Recovers After an Upstream Fault
무엇인가
이 논문은 언어모델 에이전트를 여러 단계로 쪼개 파이프라인으로 배포할 때, 앞 단계에서 발생한 결함이 뒤 단계로 전파되며 얼마나 많은 정확도를 잃게 만드는지, 그리고 그 손실을 무엇이 결정하는지를 다룬다. 저자들이 지목하는 단일 변수는 '재유도 가능성(re-derivability)', 즉 어떤 단계가 자기 일에 필요한 정보를 원래 문제로부터 얼마나 다시 만들어낼 수 있는가다. 각 단계가 직전 단계의 메시지만 보는 엄격한 파이프라인에서는 결함이 담긴 메시지가 그 단계가 가진 전부가 되므로 재유도 가능성이 0에 가까워지고, 원문을 다시 주입하면 그 값이 올라간다. 문제는 이 변수를 직접 조작한 연구가 없었다는 점이다. 기존 연구들은 실패 유형을 관찰하거나 그래프 구조의 취약성을 논할 뿐, 단계가 무엇을 볼 수 있는지는 바꾸지 않았다.
어떻게 동작하나
실험 구조는 명확하다. 파이프라인 A는 extract, set up, compute, format의 4단계로 구성되고 각 단계는 직전 단계 출력만 받는다. 파이프라인 B는 같은 과제를 understand, solve, answer의 3단계로 쪼갠 것이다. 여기에 '재그라운딩 스위치'를 두는데, 결함이 발생한 지점에서 가장 가까운 하위 k개 단계에 원래 문제를 다시 노출한다. 파이프라인 A에서는 k=0~3, B에서는 k=2까지이며, k=1은 결함 메시지를 직접 받는 단계를 재그라운딩한다는 뜻이다. 주입되는 결함은 wrong_intermediate 하나로, 첫 단계에 확률 1.0, 심각도 1.0으로 들어간다. 가짜 중간 단계와 함께 틀린 값을 담은 강제 답변 줄이 붙는다. 재그라운딩 프롬프트에는 '이 단계는 원문을 가지고 있지 않다'는 시스템 문장과 원문을 참고용으로 제공하는 사용자 문장이 나란히 들어가 모순이 생기는데, 저자들은 이를 고치지 않고 그대로 공개한다고 밝힌다.
무엇과 다른가
측정 지표는 세 가지 비율로 분리된다. PRR_matched는 같은 깊이, 같은 재그라운딩 단계 집합의 무결함 셀을 분모로 삼는 '움직이는 천장' 비율이고, 모든 용량(dose) 주장은 여기에 기댄다. PRR_deployed는 실무자가 배포할 엄격한 파이프라인을 분모로 쓰는 운영용 지표이며, PRR_occ는 가시 비율마다 고정 분모를 쓰는 차폐(occlusion) 비율이다. 백본은 Qwen3-14B(주 백본), Qwen3-8B, Phi-4, Llama-3.1-8B-Instruct 네 개의 오픈웨이트 명령 튜닝 모델을 thinking 비활성 상태로 로컬 서빙했고, 팔당 gsm_hard 120문항을 온도 0에서 평가했다. 분석 계획은 네 백본의 용량 곡선 점추정치가 이미 디스크에 올라간 뒤에 고정되었고, 저자들은 이를 사전등록이라고 부르지 않는다. 확증적 가족은 두 개뿐이다. k=0 대 k=3 종점 대비와 차폐 종점이며, McNemar 단측 검정에 Holm 보정을 α=0.05로 적용한다.
어떻게 쓰나
결과의 핵심은 결함 하 정확도가 네 백본 모두에서 오른다는 것이다. 종점 대비 효과 크기는 Qwen3-14B와 Phi-4에서 +0.392, Qwen3-8B에서 +0.375, Llama-3.1-8B에서 +0.233이며, Holm 보정 p값은 1.1×10⁻¹³에서 2.1×10⁻⁶ 사이다. k=3에서의 일치 유지율은 0.692, 0.711, 0.707, 0.957이었다. 토큰 수로 설명되지 않는다는 것도 등록된 통제로 확인했다. 문제의 모든 단어를 공백으로 바꿔 단어 슬롯 수는 유지하고 내용만 지우면, 주 백본의 유지율이 0.221로 떨어지고 가시 비율에 따라 네 백본 모두에서 상승해 0.692까지 오른다. 프롬프트 토큰 비율은 양 끝이 0.90~1.03 범위였고, Phi-4는 마스킹된 쪽이 더 긴데도 점수가 더 나빴다. 다만 결함 특이성, 즉 결함이 있을 때의 재그라운딩 이득에서 없을 때의 이득을 뺀 상호작용항 D(k)는 등록된 4단계 파이프라인에서 네 백본 중 둘에서만 0을 배제했다. 3단계 파이프라인 B에서는 4/4, 전체 메시지 이력 설정에서는 3/4에서 0을 배제했고 주 백본 값은 +0.317이었다.
전제와 한계
가장 실무적인 결과는 파이프라인 자체의 가치에 대한 것이다. 결함이 없을 때 엄격한 파이프라인의 정확도는 0.567, 0.692, 0.833, 0.200으로, 단일 직접 호출의 0.833, 0.817, 0.775, 0.517과 비교해 세 백본에서 -0.267, -0.125, -0.317만큼 진다. Phi-4만 +0.058이지만 p=0.118로 0과 구분되지 않는다. 즉 저자들이 측정한 어떤 분해도 단일 호출을 안정적으로 이기지 못한다. 반면 수리는 싸고 앞쪽에 몰려 있다. 주 백본에서 첫 번째 재그라운딩 단계가 문항당 +59.8 토큰으로 일치 유지율 +0.394를 사들이고, 그 뒤 단계들은 추가 156 토큰을 쓰고도 -0.070과 +0.000을 돌려줄 뿐이다. 917.5 토큰짜리 파이프라인 기준이다. 전체 메시지 이력을 넘겨도 결함 하에서는 차이가 없거나 Llama에서 오히려 -0.075 나빠졌는데, 결함이 첫 단계에 떨어지면 이력 자체가 오염이기 때문이다. 그라운딩된 검사자(inspector)는 블라인드 검사자보다 +0.608, +0.575, +0.608, +0.358 높았고, 두 Qwen 백본에서는 블라인드 검사자가 문항을 단 하나도 바꾸지 않았다. 결함이 없는 건강한 파이프라인에 블라인드 검사자를 붙이면 -0.192, -0.133으로 오히려 망가뜨릴 수 있다.
개발자 관점의 결론은 두 갈래다. 첫째, 여러 단계로 쪼개는 것 자체가 비용이라는 점을 먼저 확인해야 한다. 이 논문의 측정 범위에서는 파이프라인이 단일 호출보다 나았던 적이 없다. 둘째, 그래도 파이프라인을 운영해야 한다면(도구, 예산, 정책 때문에 단일 호출로 감당이 안 되는 경우) 정보를 잃은 단계에 원문을 되돌려주고, 그것도 가장 앞에서 하라. 이력 전체를 더 넘기는 것은 해결책이 아니다. 저자들은 부분적 재유도 가능성이 부분적 유지율로 이어져야 한다는 예측을 남기며, 이는 차폐 실험의 내부 곡선 모양과 일치하고 아직 검증되지 않았다고 밝힌다.
한계는 저자들이 상세히 열거한다. 모든 과제는 검증 가능한 추론이고 정답을 확인할 수 있으며, 모든 문항 수준 추론은 이 실험들이 공유하는 고정된 gsm_hard 120문항에서만 성립한다. 백본은 전부 오픈웨이트 명령 튜닝 모델이고 thinking이 꺼져 있다. 결함은 한 지점에 한 종류만 주입된 것으로 심각도 스윕이 아니다. 등록된 이전 목표 0.900은 달성하지 못했고(세 적격 백본 중 세 번째로 큰 일치 유지율이 0.692), 등록된 파이프라인에서 상호작용항이 네 백본 중 둘에서 0을 포함한다. Llama-3.1-8B는 어떤 용량에서도 결함 비용이 검출되지 않아, 결함 비용에 관한 주장은 나머지 세 백본이 전부 떠받치고 있다. 두 등록 가족 밖의 모든 결과는 탐색적이며, 저자들은 분석 계획을 데이터 이후에 고정했고 여덟 건의 날짜가 기록된 이탈을 부록에 공개한다. 또한 결함은 결정적이고 단일 지점이며 설계상 온건해서, 결함을 선택하는 적대자를 상정한 결과가 아니라고 명시한다.