컴퓨터 사용 에이전트의 실행 행동을 공통 이벤트로 정규화해 런타임 안전을 판정하는 HazardAuditor
HazardAuditor: From Executable Threats to Safer Computer-Use Agents
무엇인가
이 논문은 컴퓨터 사용 에이전트가 브라우저, 터미널, 파일 시스템, 외부 서비스와 상호작용하면서 생기는 안전 위험이 생성 텍스트만으로 드러나지 않고 실행 중 행동에서 나타난다는 문제를 다룬다. 기존 가드 모델은 정적 프롬프트와 응답을 분류하는 데 초점이 있어 에이전트 실행에 잘 맞지 않고, 기존 실행 기반 안전 플랫폼은 평가 판정은 내놓지만 이기종 에이전트 프레임워크를 아우르는 정규화된 학습 감독을 제공하지 못한다. 저자들은 악성 지시나 민감 정보가 문맥에 등장하는 것과 에이전트가 실제로 그 지시를 수행하는 것을 구분해야 한다고 본다. 예를 들어 자격 증명 유출 지시를 받고도 도구 호출을 거부하면 안전이고, 파일 읽기나 네트워크 전송 도구를 자격 증명 인자와 함께 호출하면 성공 여부와 무관하게 위험으로 라벨링한다.
어떻게 동작하나
이를 위해 HazardAuditor는 실행 기반 안전 인프라를 만든다. 안전 사례를 σ = <g, s0, Vg>로 정의하고, 관측 시점 m의 실행 궤적 τ_1:m = (e1,...,em)을 정규 이벤트로 표현한다. 이벤트는 사용자 메시지 U(u_k), 선택적 프레임워크 노출 추론 r_k를 포함한 에이전트 응답 A(a_k,r_k), 도구 이름 ν_k와 인자 α_k를 가진 도구 호출 T(ν_k,α_k), 환경 관측 O(o_k)로 구성된다. Claude Code, Codex, Hermes, OpenClaw의 네이티브 로그를 프레임워크별 어댑터로 이 스키마에 매핑하고 타임스탬프 같은 비의미 메타데이터는 제거한다. 라벨 y∈{0,1}은 문맥의 위험성 자체가 아니라 에이전트 행동을 기준으로 하며, 최소 하나의 도구 호출이나 에이전트 산출물이 과제 목표 g에 비추어 비인가 행동을 구성할 때 unsafe로 둔다. 환경 관측과 검증기 출력은 시도된 행동이 실제 효과를 냈는지 보강하는 증거일 뿐, 가드 라벨과 직접 동일시되지 않는다.
무엇과 다른가
가드 자체는 생성형 정책 πθ로, 직렬화된 궤적 x를 신뢰할 수 없는 입력으로 구분자 안에 넣고 <analysis>...</analysis> <label>safe|unsafe</label> 형식의 응답 z=[z_rat; z_ver]을 생성한다. 분석 부분은 판단 근거를 제시하고, 마지막 라벨은 하위 런타임 제어가 쓸 수 있는 결정적 인터페이스다. 초기화는 근거 감독 미세조정으로 한다. 어시스턴트 토큰에 대해서만 손실을 계산하되, 응답에서 라벨이 차지하는 비중이 작기 때문에 마지막 K_ver개 토큰에 가중치 ω_SFT를 준다. L_SFT = -Σ w_t log πθ(z_t*|x,z_<t*) / Σ w_t이며, K_ver=12, ω_SFT=4를 사용한다.
어떻게 쓰나
저자들은 SFT가 토큰 수준 모방을 최적화해, 실제 운영 목표인 하나의 안전 판정과 구조적으로 어긋난다고 지적한다. 표준 토큰 평균 목적 L_token = Σ_i Σ_t ℓ_i,t / Σ_i L_i에서는 긴 분석문이 더 많은 토큰을 가져 배치 손실에서 더 큰 비중을 차지한다. GuardPO는 각 응답에 결정적 결과를 부여한다. 파서가 ŷ_i∈{0,1,⊥}를 반환하고, 정답이면 R_i=+1, 오답이면 -1, 형식 오류면 -γ(γ=1.25)를 준다. 배치 B의 평균 R̄_B를 빼서 Â_i=R_i-R̄_B를 만들고, 응답 내 모든 유효 토큰에 같은 시퀀스 어드밴티지를 할당한다. 토큰 업데이트는 π_old 대비 중요도 비율 ρ_i,t를 1±ε(ε=0.1)로 클리핑하고, CISPO처럼 ℓ_i,t = -sg(ρ̃_i,t) Â_i log πθ(z_i,t|...)로 계산한다. 핵심은 집계 방식이다. 응답 i의 마지막 K_ver개 유효 토큰을 V_i, 그 앞의 분석 토큰을 R_i라 하고 M_i(S)=1/|S| Σ_{t∈S} ℓ_i,t로 두면, L_GuardPO = 1/N Σ_i [M_i(R_i) + λ_ver M_i(V_i)]이고 K_ver=12, λ_ver=2를 쓴다. 이렇게 하면 각 응답이 길이와 무관하게 정규화된 분석 항 하나와 라벨 항 하나를 기여하므로, 최적화의 실질 단위가 설명 토큰 수가 아니라 안전 판정이 된다. 논문은 분석 토큰을 q번 복제해도 응답 기여가 변하지 않는 길이 불변성(Proposition 1)을 증명한다.
전제와 한계
실험은 Qwen3Guard-Gen-8B에서 시작해 16K 토큰 입력 예산, 전역 배치 16, AdamW, 학습률 5×10^-6로 10에폭 전체 파라미터 SFT를 수행한다. 입력이 예산을 넘으면 궤적 앞부분을 남기는 접두부 보존 절단을 한다. 주 평가는 자체 인프라로 수집한 CUA-Exec로, Claude Code, Codex, Hermes, OpenClaw 각각 200개 궤적을 안전/불안전 동수로 층화 샘플링하고 안전 사례 수준에서 학습에서 제외한다. 추가로 AgentHazard, ATBench, R-Judge, ASSE-Safety를 평가한다. 비교 대상은 GPT·Claude·Gemini·Qwen 계열 궤적 판정 모델, Llama Guard·Qwen3Guard·NemoGuard·YuFeng-XGuard 같은 범용 가드, ShieldAgent·AgentDoG·AgentDoG 1.5·BraveGuard 같은 에이전트 지향 가드다. Table I에서 단일 HazardAuditor가 네 에이전트 모두에서 모든 보고 지표 최고를 냈고, 가장 강한 기존 에이전트 지향 가드인 BraveGuard 대비 정확도가 Claude Code 12.5, Codex 4.0, Hermes 9.5, OpenClaw 16.5 퍼센트포인트 향상됐다. Macro-F1 향상은 각각 13.0, 4.0, 10.2, 18.7 퍼센트포인트다. GuardPO는 SFT 초기화보다 네 균형 부분집합 모두에서 정확도를 높여 Claude Code 82.0→94.0, Codex 91.0→95.5, Hermes 75.0→86.5, OpenClaw 74.0→87.5로 만들었다.
AgentHazard에서는 GPT-5.5, Claude Sonnet 4.6, Gemini 3.1 Pro, Qwen3-235B-A22B 백엔드 실행에 대해 HazardAuditor가 기존 궤적 학습 베이스라인과 대등하거나 능가했다. GPT-5.5, Claude Sonnet 4.6, Qwen3-235B-A22B에서 최고 정확도를, Claude Sonnet 4.6, Gemini 3.1 Pro, Qwen3-235B-A22B에서 최고 F1을 기록했다. 같은 SFT 초기화 대비 F1은 GPT-5.5 82.24→84.31, Claude Sonnet 4.6 83.03→85.98, Gemini 3.1 Pro 93.28→95.07, Qwen3-235B-A22B 92.30→92.51로 올랐다. 인프라 밖 세 궤적 벤치마크에서는 ASSE-Safety에서 정확도와 F1 91.5%, ATBench에서 정확도 88.4%로 최고를 냈고, R-Judge에서는 SFT 초기화가 근소하게 더 강했다. 세 벤치마크 전체 최악 F1은 HazardAuditor 88.3%, HazardAuditor-SFT 86.2%, 최고 기존 가드 80.7%였다. Qwen3-Guard가 ATBench에서 정밀도 100%, 재현율 10.8%처럼 높은 정밀도·낮은 재현율 영역에 머무는 반면, HazardAuditor는 모든 데이터셋에서 정밀도-재현율 격차를 1.1포인트 이하로 유지했다. 절제 실험에서는 실행 기반 데이터만으로도 최강 베이스라인과 맞먹고, GuardPO가 교차 에이전트 궤적에서 추가로 10.4포인트를 더한다고 보고한다.
개발자 관점에서 이 논문은 에이전트 런타임 가드레일을 붙일 때 프롬프트·응답 필터만으로는 부족하고, 도구 호출 이름과 인자, 관측, 이전 상호작용을 공통 스키마로 모아 판정해야 한다는 설계 지침을 준다. 또한 가드 학습 목표를 토큰 수가 아니라 안전 판정 단위로 정규화해야 긴 설명문이 학습을 지배하는 문제를 피할 수 있다는 점이 실무적으로 중요하다. 다만 저자들이 밝힌 한계도 분명하다. AgentHazard의 GPT-5.5 백엔드에서는 HazardAuditor가 최고 정확도를 냈지만 BraveGuard가 더 높은 재현율과 F1을 유지했고, R-Judge에서는 SFT 초기화가 근소하게 앞섰다. GuardPO는 교차 벤치마크의 최악 성능 바닥을 올리지만 모든 소스에서 단조로운 향상을 주지는 않으며, 백엔드별 추가 캘리브레이션이 필요하다고 논문은 인정한다. 또한 라벨은 환경 응답이 아니라 시도된 행동을 기준으로 하고, 프레임워크가 노출하지 않는 추론 r_k는 빈 값으로 두며, 긴 입력은 접두부 보존 절단을 한다는 전제 위에서 결과를 해석해야 한다.
관련 논문
- 평범한 과제 압박만으로 LLM 에이전트가 런타임 모니터를 우회한다런타임 모니터가 금지한 조작을 일반 과제 완수에 반드시 써야 하는 상황에서 LLM 에이전트가 스스로 감시를 피하려는 '도구적 회피'를 측정한 EvasionBench 연구다. 50개 과제-정책 쌍에서 최대 98% 회피 시도율과 88% 성공률이 관찰됐고, 추론 예산이 늘수록 회피율도 상승했다.
- 단계별 그래디언트만으로 임바디드 에이전트의 관측-행동 궤적을 복원하는 시간적 역전 공격임바디드 강화학습에서 서버로 전송되는 단계별 정책 그래디언트만으로 에이전트의 관측-행동 궤적 전체를 복원하는 TRACE 공격을 제안한다. AI2-THOR 실험에서 18.8dB PSNR과 사실상 완벽한 행동 복원을 프레임당 3~4.5ms에 달성했다.
- API 도구 호출로 꺼낸 숨은 사고 연쇄, 압축된 추론은 약한 모델이 못 읽는다폐쇄형 프런티어 모델의 숨겨진 사고 연쇄를 API 도구 호출로 끌어내 검증하고, 토큰 효율·추론 단계·추론 트리 구조로 모델별 차이를 비교한 연구다. 압축된 추론 트레이스는 강한 모델만 온전히 재사용한다는 감독 신호의 상대성을 보여준다.
- InGuard는 생성 파이프라인 내부 표현으로 T2I 안전성을 높인다.T2I 파이프라인 안쪽에서 텍스트 임베딩과 중간 latent를 검사해 NSFW 생성을 막는 InGuard를 제안한다. 5개 오픈웨이트 모델에서 안전률 97.9~98.8%를 기록하며 기존 외부 가드레일보다 파라미터와 연산을 줄였다.