규제 도메인 에이전트의 자율 범위를 측정하는 진단 하네스 RegLLM

Evaluating Bounded Autonomy in Regulated Agentic AI: A Diagnostic Harness with Constitutional Rewards, Escalation Labels, and Runtime Governance

HF Daily2609.37501

Dipankar Sarkar2026-09-28

무엇인가

금융 컴플라이언스, 의료 조언, 법률 트리아지처럼 규제가 걸린 고위험 영역에 LLM 에이전트가 투입되고 있다. 이런 곳에서 틀린 답의 대가는 정정 답변이 아니라 규제 과징금, 피해를 입은 고객, 놓친 의무다. 수학이나 코드처럼 기계가 검증할 수 있는 정답이 있는 영역에서 성공한 검증가능 보상 강화학습(RLVR)은 규제 자문에 그대로 옮겨지지 않는다. 기존 에이전트 안전 연구는 위험 행동을 감시하고 차단하는 장치를 주지만, 규제 워크플로의 핵심 결정인 '언제 답하고 언제 자격을 갖춘 사람에게 넘길 것인가'를 학습할 원리 있는 방법은 주지 않는다. 현재 이 결정은 손으로 박아 넣은 임계값에 산다. 논문은 이 행동 대 위임 결정 자체를 검증 가능한 학습 신호로 다룬다.

어떻게 동작하나

RegLLM은 여섯 개 신뢰성 신호를 계측하는 진단 하네스다. 인용 유효성, 출처 근거성, 스키마 준수, 에스컬레이션 정확성, 헌법 정합성 점수, 안전하지 않은 행동 비율이다. 저자는 이 신호들을 무엇이 신뢰를 보장하는가에 따라 세 갈래로 나눈다. 프로그램으로 검증 가능한 신호(인용 유효성, 스키마 준수, 출처 근거성), 과제 수준 에스컬레이션 라벨(에스컬레이션 정확성), AI 심판 점수(헌법 정합성)다. 근거성은 예제 구현에서 답변과 인용 출처 사이의 어휘 중첩 프록시로 계산하며, 더 풍부한 구성에서는 NLI 모델이나 심판으로 대체할 수 있다. 방법론의 핵심 전환은 각 과제에 should_escalate 라벨을 붙여 행동 대 위임 결정을 검증 가능한 목표로 만드는 것이다. 도메인 헌법(예제에서는 영국 FCA 핸드북에서 뽑은 16개 원칙으로, 금융 윤리, 규제 준수, 전문가 책임, 윤리적 AI 네 영역)이 두 역할을 겸한다. 하이브리드 보상의 소프트 항과 런타임 자율 범위 정책이다. 에이전트는 retrieve, cite, answer, escalate 네 도구를 쓰는 ReAct 루프로 동작하고, 궤적 전체가 보상 계산과 감사 로그의 기반이 된다.

무엇과 다른가

보상은 R(τ) = w_v·R_v(τ) + w_c·R_c(τ) − λ·1[가드레일 위반] 형태다. 검증가능 항 R_v는 인용 유효성, 근거성, 스키마 준수, 에스컬레이션 정확성(escalated == should_escalate의 지시함수) 네 하위 신호의 평균이다. 헌법 항 R_c는 원칙을 샘플링해 AI 심판이 Yes/Partial/No를 1.0, 0.6, 0.3으로 매핑해 채점한다. 학습은 궤적을 R로 순위 매겨 선호 쌍을 만들고 소형 오픈 모델에 LoRA를 붙여 DPO로 훈련한다. 확장 구성은 R을 그룹 상대 보상으로 쓰는 GRPO다. 추론 시에는 모델 바깥의 결정론적 거버넌스 계층이 세 가지를 한다. 조항을 인용하지 않은 답변을 차단하고 에스컬레이션을 강제하며(Proper Sourcing 원칙 P9), 역량 경계나 불확실성 원칙(P10~P12)이 발동되면 에스컬레이션을 강제하고, 모든 단계와 개입을 발동 원칙 id로 키를 잡은 추가 전용 감사 로그에 기록한다.

어떻게 쓰나

실험 데이터는 영국 FCA 핸드북 모듈(PRIN, COBS, SYSC, CONC)을 파싱한 조항 코퍼스다. 범위 내 과제는 여섯 개 지시 템플릿(정의, 적용, 시나리오, 비교, 준수 점검, 리스크 평가)으로 생성하고, 범위 밖(should_escalate=True) 과제는 다섯 개 트리거 템플릿(세무 구조화 요청, 보증 요구, 규제기관 미래 행동 예측, 법률 의견 요청, 존재하지 않는 조항 인용)으로 만든다. escalation_fraction은 0.25다. 모든 라벨은 저자가 템플릿으로 생성한 것이고 법률 서비스 컴플라이언스 전문가의 주석은 받지 않았으며 평가자 간 일치도도 보고하지 않는다. 오프라인 참조 실행(n=12)에서 결정론적 런타임 감독자는 약한 베이스라인의 에스컬레이션 재현율을 0에서 0.67로 끌어올리고, 인용 유효성을 1.0으로 올리고, 안전하지 않은 행동 비율을 0.33에서 0.08로 줄였다.

전제와 한계

GPU 파일럿은 Qwen2.5-3B, 저온 샘플링, 휴리스틱 심판, n=8, 시드 0으로 같은 평가 분할에서 돌렸다. Run A는 답변 품질 DPO 어댑터 하나(10쌍, 30스텝), Run B는 답변 품질과 에스컬레이션 인지 DPO 어댑터 둘(각 20쌍, 30스텝)을 훈련했다. Run A의 AQ 어댑터는 최종 DPO 손실 0.59, 보상/마진 0.22, 정확도 1.0에 도달했고, Run B의 AQ는 손실 0.67, 마진 0.12, EA는 손실 0.69, 마진 0.04였다. 문제는 두 실행 사이의 분산이다. RL-base 에스컬레이션 재현율은 1.00에서 0.50으로, 과제 성공률은 0.25에서 0.12로 반감했고 인용 유효성은 0.50에서 0.38로 떨어졌다. 같은 AQ 어댑터가 Run A에서는 에스컬레이션을 1.0에서 0.5로 떨어뜨리는 것처럼 보였고 Run B에서는 0.5에서 1.0으로 회복시키는 것처럼 보였다. Run A에서 가설로 세운 실패 모드를 겨냥해 Run B에 추가한 에스컬레이션 인지 변형은 측정 가능한 변화를 만들지 못했다. 두 실행 모두에서 런타임 감독자의 개입 횟수는 0이었다. 모델이 답하는 모든 턴에서 조항을 인용해 무인용 게이트를 통과했고, 에스컬레이션을 놓친 궤적은 게이트가 검사할 최종 답변에 도달하지 않았기 때문이다.

개발자 관점에서 이 논문의 실용적 메시지는 두 갈래다. 하나는 규제 도메인 에이전트를 만들 때 행동 대 위임 결정을 손으로 튜닝한 임계값에 두지 말고 라벨이 붙은 학습 및 평가 대상으로 다루라는 것, 그리고 헌법 같은 단일 산출물을 보상과 런타임 가드레일에 동시에 쓰면 평가, 학습, 서빙이 같은 기준으로 묶인다는 것이다. 다른 하나는 더 뼈아프다. n=8, 10~20개 선호 쌍, 30 DPO 스텝 규모의 스모크 파일럿에서는 어댑터 효과가 샘플링과 하드웨어 분산에 묻힌다. 단일 실행의 결과를 근거로 어댑터가 좋아졌다거나 나빠졌다고 주장하면 안 된다. 저자는 코드 커밋, 평가 분할, 시드, 베이스 모델 식별자, 정책 하이퍼파라미터를 공유했지만 컨테이너 이미지 다이제스트와 패키지 마이크로버전을 고정하지 않았고 결정론적 CUDA 플래그도 켜지 않았기 때문에, 부동소수점 연산 순서, 커널 선택, pip가 해석한 transformers/peft/trl 마이크로버전 차이가 분산의 유력한 후보라고 밝힌다. 이 프레임워크는 규정집이 문서로 존재하고, 어떤 질의가 에이전트 역량 밖인지 식별할 방법이 있고, 파인튜닝할 소형 오픈 베이스 모델이 있는 팀을 위한 것이다. 턴키 안전 제품이 아니며 헌법, 코퍼스, 에스컬레이션 라벨은 여전히 실무자의 몫이다.

저자가 명시한 한계는 분명하다. 오프라인 참조 실행은 n=12, GPU 파일럿은 n=8이며 단일 시드, 단일 베이스 모델(Qwen2.5-3B), 단일 규제 도메인(영국 FCA)만 다뤘으므로 절대 수치를 프로덕션 벤치마크와 비교하면 안 된다. 에스컬레이션 정확성은 should_escalate 라벨이 신뢰할 만할 때만 검증 가능한데, 규제 도메인의 라벨은 전문가 주석이 필요하고 때로 논쟁적이며 규제 변화에 따라 달라진다. 이 논문의 라벨은 템플릿 기반 저자 생성이고 평가자 간 일치 프로토콜도 아직 없다. 헌법 정합성 점수는 심판 모델에 의존하며, 여기서는 재현성을 위해 휴리스틱 심판을 썼기 때문에 호스팅 API 심판을 쓰면 절대 점수가 달라질 것으로 예상된다. 심판 보정, 심판 간 일관성, 적대적 탐침은 프로덕션에 필요하지만 이 연구에서는 하지 않았다. 런타임 거버넌스는 두 GPU 파일럿에서 무용했고, 프레임워크가 제시하는 수정(심판 기반 역량 경계 트리거)은 추론 시점의 보정된 심판이나 스모크 파일럿보다 풍부한 베이스 모델 행동을 요구한다. 헌법은 소프트웨어적으로 도메인 교체가 가능하지만 실제로 인스턴스화해 평가한 것은 FCA 예제 하나뿐이다.