결정론적 계약 검증으로 멀티에이전트 LLM 핸드오프 오류 전파를 막는 Maat
Maat: Independent Deterministic Contract-Based Governance for Multi-Agent LLM Workflows
무엇인가
LLM 기반 멀티에이전트 시스템은 고유한 신뢰성 문제를 안고 있다. 한 에이전트가 만든 오류가 하류 에이전트에게 컨텍스트로 수용되면서 워크플로 전체로 전파된다는 점이다. 논문은 MAST 같은 실패 분류 연구가 시스템 설계, 에이전트 간 불일치, 작업 검증 범주에 걸쳐 14개 실패 모드를 보고하며 그 비중이 각각 44.2%, 32.3%, 23.5%라고 인용하고, 중앙 검증이 없는 구조가 트레이스 수준 오류를 훨씬 크게 증폭시킨다는 통제 실험도 언급한다. n번의 순차 핸드오프와 단계별 성공 확률 p에 대해 종단 성공률을 p^n으로 근사하는 직관도 제시한다. 문제는 기존 안전장치 상당수가 학습된 또는 LLM 기반 판정자에 의존한다는 것이고, 그 판정 자체가 확률적이며 자기가 잡으려는 실패 모드를 물려받을 수 있다는 점이다. 저자들의 질문은 좁다. 계약으로 탐지 가능한 핸드오프 결함을, 또 다른 언어모델에게 묻지 않고 결정론적 계층이 막을 수 있는가.
어떻게 동작하나
Maat은 에이전트 간 핸드오프를 버전 관리된 워크플로 계약, 즉 앵커(anchor)에 비추어 검증하는 런타임 거버넌스 계층이다. 검증과 채점 경로 어디에도 언어모델이 들어가지 않는다. 공개된 시스템 모델에서 워크플로는 방향 그래프 G=(V,E)로 표현되고 노드는 에이전트, 엣지는 핸드오프다. 각 핸드오프는 구조화된 페이로드와 실행 메타데이터, 관련 워크플로 상태를 싣고 다니며, Maat은 선택된 엣지에 삽입되어 관측된 핸드오프를 앵커와 비교한다. 고정된 엔진 버전, 고정된 앵커, 고정된 공개 설정, 동일한 핸드오프 상태라면 검증기는 같은 판정을 낸다. 공개 아키텍처는 일곱 개 게이트로 구성된다. G1 계획 검증, G2 핸드오프 검증, G3 검증 깊이 제어, G4 역할 준수와 무결성, G5 생존·건강 모니터링, G6 지속적으로 실패하는 에이전트를 위한 서킷 브레이커, G7 핸드오프 간 엔티티 일관성이다. 이 구조적 게이트들 위에 지급 한도, 허용 할인, 세금 처리, 제공자 자격, 데이터 레지던시 같은 도메인 규칙을 담은 요구사항 프리미티브가 놓인다. 저자들이 강조하는 구분은 명확하다. 구조적 게이트는 워크플로와 핸드오프가 잘 형성되었는지를 보고, 요구사항 프리미티브는 잘 형성된 핸드오프가 지배 계약에 의해 허용되는지를 본다. 문법적으로 유효한 값이 계약상 틀릴 수 있다. 반대로 Maat은 모든 환각을 탐지한다고 주장하지 않는다. 인코딩된 구조·계약 규칙을 위반하지 않는 의미적으로 거짓인 진술은 통과할 수 있다. CrewAI 통합 아티팩트도 구현됐는데, 로컬 구조 체인 분석기(끊긴 엣지, 도달 불가 단계, 고아 시작점 등 배선 결함 보고), 핸드오프에 validate()를 삽입하는 경량 런타임 커넥터, 그리고 계약이 10%만 허용하는데 40% 할인을 적용한 가격 페이로드를 REQ_DISCOUNT_EXCEEDED로 거부하는 intake-pricing-invoice 데모로 이루어진다.
무엇과 다른가
실험은 6개 통제 도메인 워크플로(에이전트 6~15개, 총 522회 시행)에서 주입된 데이터 수준 결함과 결정론적 7항목 루브릭(0~7 정규화, 채점 경로에 LLM 판정자 없음)으로 수행됐다. 각 벤치마크는 off(무보호 기준선), warn(발견 사항을 기록하되 실행 지속), intervene(차단 발견 시 체인 종료 또는 우회)의 3개 군으로 실행되고, 보고되는 정확성·비용 비교는 off와 intervene을 쓴다. 도메인은 B2B 리드-투-인보이스, 병원 트리아지, 소프트웨어 개발, 엔터프라이즈 프로세스 디스커버리, 이커머스 에이전시(15개 에이전트, 2개 클라이언트, 다중 마켓플레이스), 건강보험 심사이며, 베이스 모델은 Claude Haiku 4.5 단일 모델이다.
어떻게 쓰나
결과의 핵심은 버전 1과 수정된 버전 2의 차이다. 버전 1은 6개 워크플로 모두에서 2.9~26.5%의 루브릭 향상을 보고했다. 그러나 게재 후 감사에서 세 개 벤치마크 채점기가 조기 중단을 무조건 방어된 결함으로 인정했다는 사실이 드러났다. 즉 오경보 중단이 적중으로 계산됐다. 새 모델 호출 없이 모든 트랜스크립트를 재채점한 결과, governed 실행이 완료되었거나 검증된 결함에 귀속되는 발견으로 중단된 페어 시행에서 루브릭 점수 변화는 5개 워크플로에서 +7.7%에서 +29.1%였고 소프트웨어 개발에서는 +0.8%로 평탄했다. 귀속 가능한 중단이 이르게 발생한 경우 모델 호출 비용은 17~53% 감소했다. 다만 94개 governed 군 중단을 전수 수동 검토한 결과 45개는 주입 결함을 막았고, 13개는 주입되지 않은 실제 결함(거래 총액과 라인 항목 불일치, 필수 필드 누락, 네트워크 외 지급)을 막았으며, 1개는 정당한 에스컬레이션이었고, 나머지 35개(37%)는 정상 출력에 대한 오경보다. 오경보를 실패한 작업으로 계산하면 governed 군은 6개 워크플로 중 4개에서 ungoverned 군보다 낮은 점수를 받는다. B2B 이득은 17개 페어 중 8개가 주입되지 않은 산술 오류 중단에 기대고 있고, 병원 이득은 22개 중단 중 16개가 미귀속이라 단 9개 페어에 의존한다. 버전 1의 '모든 워크플로에서 개선' 주장은 철회되고, 지지되는 주장은 '중단이 귀속 가능한 곳에서 결함 전파를 막는다'로 좁아진다.
전제와 한계
오경보의 원인은 모델 행동이 아니라 검증기 결함이었다. 22개 중단은 이전 시행에서 이월된 서킷 브레이커 상태가 검증을 최엄격 깊이로 승격시킨 탓이었고, 그 깊이에서는 provenance가 필수인데 검사가 최상위 키만 인식해 에이전트가 제공한 필드 수준·항목별 provenance를 무시했다. 8개는 '선언된 알레르기 없음'이나 '문서화된 병력 없음' 같은 정당한 빈 응답을 빈 핸드오프로 처리한 경우, 4개는 정당한 EUR 0 거부를 지급 대상 기대액과 비교한 경우, 1개는 국가별 트랜잭션 수를 세율로 파싱한 경우였다. 오경보 분포는 병원 트리아지 22개 중 17개, B2B 20개 중 8개, 보험 22개 중 6개, 소프트웨어 개발 7개 중 3개, 이커머스 18개 중 1개, 엔터프라이즈 디스커버리 5개 중 0개다. 반대로 실제로 잡힌 계약 위반 사례로는 세 마켓플레이스에서 같은 SKU가 EUR 27.99, 21.99, 19.99로 갈라진 크로스 마켓플레이스 가격 드리프트, 관할권 의존 VAT·세금 오분류, 계약상 정답이 EUR 810인데 EUR 1,310이 전파된 지급액 인플레이션, 정책 소유자 식별자 변경으로 나타난 청구인 신원 드리프트, 특수 범주 의료 데이터를 비EU 처리로 표시한 데이터 레지던시 위반, 벤치마크가 주입하지 않았는데 이커머스 분석 에이전트가 마켓플레이스 매출을 반복 이중 계산한 사례가 있다. 마지막 사례는 버전 1에서 경고로만 기록되고 체인을 멈추지 않았으며 v2에서 차단 규칙이 됐다. 데이터 오염 시나리오가 자연스럽게 자극하지 않는 메커니즘을 위한 별도 공개 테스트도 있다. 서킷 브레이커 벤치마크는 건강한 파이프라인에서 오작동 0%, 만성 실패 프로파일에서 100% 작동, 만성 실패 에이전트를 브레이커 없이 돌리는 것보다 약 37% 낮은 비용을 보고한다. 검증 깊이 스윕은 thorough와 light 검증 사이에서 시행당 4개의 추가 발견을 보고하고, 결함 트래픽에서는 이른 중단이 하류 호출을 건너뛰어 총비용이 낮아진다고 밝힌다. 생존 모니터링은 보편 임계값이 아니라 캘리브레이션 의존으로 규정된다.
개발자 관점에서 실무적 의미는 세 가지다. 첫째, Maat은 warn 모드로 시작해 앵커를 캘리브레이션하고, intervene 모드로 전환하는 배포 자세를 지원한다. 측정된 하류 비용 절감은 intervene만 만들 수 있는데, 탐지된 결함 이후의 모델 호출을 막는 것은 intervene뿐이기 때문이다. 차단된 핸드오프를 사람 검토자에게 라우팅하는 것은 EU AI Act의 고위험 시스템 인간 감독 요건을 지원하는 한 방법이지만, 검증기 자체가 규정 준수를 구성하지는 않는다. 둘째, 적합한 곳과 아닌 곳이 갈린다. 보험 약관, 계약 가격 한도, 재무 승인, 세금 규칙, 데이터 레지던시, 승인된 신원, 임상 프로토콜 제약, 서비스 수준 의무처럼 안정적이고 검사 가능한 권위 원천이 있고 위반 핸드오프 하류에 비싸거나 규제적인 결과가 있을 때 유용하다. 하류 에이전트가 이미 강한 독립적 중복성을 갖는 경우(소프트웨어 개발 벤치마크가 이 사례로, 에이전트들이 상류 요구사항을 자주 재도출해 외부 게이트의 부가 가치가 작다), 인코딩할 안정적 계약이 없는 경우, 순수하게 의미적인 실패에는 설득력이 떨어진다. 셋째, 결정론은 정확성과 다르다. 잘못 설정된 결정론적 규칙은 매번 같은 방식으로 틀린다. 실무적 이점은 진단 가능성과 재현성이고, 실무적 부담은 앵커 구성과 시나리오 조건부 기대값 자체를 테스트해야 한다는 것이다. 저자들은 평가 대상이 검증기 바이너리 단독이 아니라 엔진 버전, 앵커 버전, 설정 상태의 배포된 조합이라고 규정하고, 설정 상태를 결과와 함께 버전 관리하라고 요구한다.
한계는 저자들이 상당히 구체적으로 밝힌다. 도메인 결과는 단일 베이스 모델(Claude Haiku 4.5)만 사용해 교차 모델 일반화가 미해결이다. 벤치마크는 실제 운영 체인을 닮도록 설계됐지만 조직·법률·데이터 품질·지연 조건을 재현하지는 않는 합성 워크플로다. 수정된 페어 추정치는 B2B 17개, 병원 9개로 표본이 작고, B2B 앵커는 5개 고객 시드 전체에 단일 고객의 계약을 인코딩해 앵커 기반 B2B 검사가 한 시드에서만 의미가 있다. 검증기는 앵커와 규칙 바인딩만큼만 정확하며, 문서화된 보험 오경보가 이를 이론적 우려가 아닌 측정된 한계로 만든다. 공개 증거는 핸드오프 완전성, 요구사항 프리미티브, 엔티티 일관성, 검증 깊이, 생존 캘리브레이션, 서킷 브레이킹에서 가장 강하고, 선언된 모든 게이트가 동등하게 검증됐다고 주장할 근거는 없다. 공개 요약이 집계 평균과 프로파일 결과만 제공하므로 저자들은 p값, 신뢰구간, 유의성 표현을 의도적으로 피한다. 비용 수치는 벤치마크 특정적이고 이식 가능한 메커니즘은 조기 종료 후 하류 추론을 건너뛰는 것이다. 무엇보다 이 결과는 보편적 정확성, 환각 탐지, 모델 독립적 효과를 입증하지 않는다. 저자들은 대신 검증 가능한 가설을 제시한다. 고정된 결정론적 계약으로 표현 가능한 결함에 대해 검증기 판정은 생성 에이전트가 쓰는 모델에 불변인 반면, 그런 결함이 실제로 발현되는 빈도는 모델 의존적이라는 것이다. 이를 검정할 다음 결정적 실험은 워크플로, 시드, 앵커, 주입, 검증기 버전을 고정하고 베이스 모델만 더 강한 모델과 비용 최적화 모델로 교체하는 페어 교차 모델 실험이며, 이는 아직 수행되지 않았다. 벤치마크 방법론과 공개 결과 파일은 공개 저장소에 있고 CrewAI 통합 아티팩트도 제공되지만, 독점 conductor 구현과 전체 설정 방법론은 공개되지 않아 제3자가 소스만으로 모든 종단 결정을 독립 재현할 수는 없다.