툴 쓰는 AI 에이전트의 공격과 방어를 상태 전이 문제로 다시 정의한다

SEAD: A State-Based Perspective on Attack and Defense in Tool-Using Agents

HF Daily2609.34518

Xinjie Shen, Junran Wang, Rongzhe Wei2026-09-28조회 4

무엇인가

LLM 에이전트가 파일 수정, 권한 변경, 데이터베이스 기록, 웹 조작 같은 툴 호출로 외부 시스템에 실제 상태 변화를 일으키면서 안전성 문제의 성격이 달라진다. 앞선 행동이 남긴 상태 때문에 나중의 평범해 보이는 행동이 해로워질 수 있는데, 에이전트·공격자·방어자가 보는 관측은 각자 역할에 따라 잘려 있어 그 상태가 드러나지 않는다. 같은 업로드 동작도 진단 파일을 옮기는 일이 될 수도, 인증 쿠키 데이터베이스를 유출하는 일이 될 수도 있다. 이 논문은 이 상황을 SEAD(State-grounded Execution for Attack and Defense)라는 부분관측 상태 제어 문제로 정식화한다. 상태 전이 함수 F와 관측 함수 Ω로 실행을 모델링하고, 방어자는 실행 전에 PASS 또는 BLOCK을 결정하며, 해로운 목표 g가 처음 실현되는 전이를 경계 β_g(s,u)=1{H_g(s)=0, H_g(F(s,u))=1}로 정의한다. 방어자의 증거와 양립하는 두 상태가 서로 반대 결정을 요구하면 그 결정은 상태 모호(state-ambiguous)하며, 이때 이력만으로는 판단할 수 없다는 것이 핵심 논점이다.

어떻게 동작하나

공격자 역할에서 제안하는 DART(Decomposed Attacks with Runtime Feedback and Tree Search)는 해로운 목표를 지역적으로 그럴듯한 중간 단계들로 분해하고, 실제 툴 실행에서 나온 피드백으로 트리를 탐색한다. 각 노드는 실행된 궤적 접두, 타깃이 본 이력, 그 결과 상태를 담는다. 확장 가능한 노드에서 제안 정책 π_prop이 목표와 부모 이력을 보고 후보 지시를 여러 개 만들고, 각 후보를 실제로 실행해 자식 노드를 만든다. 노드 가치는 실행 가능 검증기가 확인한 진행도 P_v, 제안의 유용성을 보는 LLM 내성 평가 I_v, 관측된 실행을 보는 피드백 평가 C_v를 Q_v = 0.20·I_v + 0.30·C_v + 0.50·P_v로 결합해 초기화한다. 경로는 목표 완료 확인, 반복 거부, 탐색 예산 소진 중 하나로 종료되고, 종료 사유를 반영한 보상이 경로를 따라 백업된다. 이후 UCT로 다음에 확장할 접두를 고른다. 성공 판정은 태스크별 실행 검증기 V_g와 독립 LLM Judge를 함께 쓴다.

무엇과 다른가

방어자 역할의 SAGE(State-Aware Gating through Exploration)는 실행 전 결정과 선택적 상태 조사를 결합한다. 방어자는 대기 중인 행동 u_n과 자신의 이력 h_n^D만으로 그 행동이 현재 상태에서 해로운 경계를 넘는지 판단해야 하는데, 의심스러운 의도만으로는 부족하다. 그래서 질의 예산 K 안에서 읽기 전용 질의 q_k를 던져 방어자 전용 관측 o_k^D를 모으고, 그 비공개 조사 기록 η_k를 근거로 PASS 또는 BLOCK을 정한다. 질의는 보호 대상 상태를 바꾸지 않는다. 예컨대 스크립트와 설정 파일을 읽어 승인된 테스트 업데이트인지 보호된 레코드 수정인지 구분한 뒤 명령 실행 여부를 결정한다. 차단되면 거부 피드백이 타깃 이력에 들어가고, 타깃이 다시 계획한 모든 툴 호출은 게이트를 다시 통과한다. SAGE는 대기 중인 행동마다 하나의 학습 레코드를 두고 지도 미세조정으로 배운다. 무해 행동과 해로운 마감 직전 행동에는 PASS, 마감 행동에는 BLOCK 라벨을 붙인다.

어떻게 쓰나

실험은 MT-AgentRisk의 태스크·환경·실행 평가기를 Filesystem, Terminal, PostgreSQL, Web 네 도메인의 악성 태스크 187개로 옮겨 구성했다. RQ1은 187개 전체를 GPT-5.6 Luna, GPT-5.6 Terra, Gemini 3.8 Flash, Claude Sonnet 5 네 타깃에 돌린다. DART의 공격자 구성요소는 Huihui-Qwen3.8-27B-abliterated를 쓰고, 비교 베이스라인도 같은 백본을 쓴다. 베이스라인은 단일 지시(Direct), MT-AgentRisk의 고정 다중 턴 분해(MTA), 합성 툴 사용 맥락 뒤 적응 상호작용을 하는 STAC, 대화 전략을 만든 뒤 매 턴 프롬프트를 다듬는 Intent Hijacking이다. DART는 두 판정 기준 모두에서 모든 타깃에 대해 최고 ASR을 냈고, 각 타깃의 최고 베이스라인보다 의미론적 성공률이 18.8~35.9%포인트, 실행 검증 기준 성공률이 8.1~17.9%포인트 높았다. 저자들은 다중 턴 상호작용 자체가 성공을 보장하지 않는다는 점, 즉 순응적인 응답을 끌어내는 것은 중간 단계일 뿐이고 실제 툴 실행이 해로운 목표를 실현해야 성공이라는 점을 강조한다.

전제와 한계

RQ2는 기록된 궤적에서 안전성과 유용성의 맞바꿈을 본다. 해로운 궤적은 75개 태스크 부분집합에 대한 DART 실행에서, 무해 대조군은 OpenAgentSafety에서 가져와 목표를 무해하게 다시 쓴 95개 궤적(툴 행동 770개)으로 만든다. SAGE는 95개 무해 궤적 중 91개에서 모든 행동을 통과시켜 B=95.79%를 유지하면서 H1=34.55%, H2=58.79%를 기록했고, 조화평균 F1=50.78%, F2=72.86%로 평가된 방어자 중 가장 높았다. 미세조정 이진 분류기와 비교하면 B를 4.21%포인트 양보하고 해로운 차단을 65.45%포인트 얻는다. 차단 시점 분석에서도 SAGE는 Exact 비율이 가장 높았고, TS-Guard 대비 Early 차단을 78.18%에서 58.18%로, Miss를 14.55%에서 7.27%로 줄였으며 Late 차단은 없었다. RQ3는 차단이 이후 궤적을 바꾸는 온라인 평가다. SAGE는 DART의 의미론적 ASR을 65.3%에서 10.7%로, 실행 검증 ASR을 48.0%에서 4.0%로 낮췄다. 미세조정 이진 분류기는 RQ2에서 무해 궤적을 100% 통과시켰지만 온라인 실행 검증 ASR은 48.0% 그대로였다. 학습에서 제외한 PostgreSQL과 Web 30개 태스크에서도 SAGE는 DART의 의미론적 성공을 20건에서 3건으로, 실행 검증 성공을 9건에서 1건으로 줄였다. 네 가지 공격 방법 모두에서 ASR이 줄었고, 가장 높은 잔여 수치는 Intent Hijacking의 13.3%(의미론적)·6.7%(실행 검증)였다.

실무적으로 이 논문이 주는 메시지는 툴 호출 하나를 텍스트만 보고 판단하는 가드레일은 상태 의존적 위험을 놓친다는 것이다. 같은 명령이 어떤 상태에서는 정상 배포고 다른 상태에서는 보호된 레코드 파괴일 수 있으므로, 실행 직전에 읽기 전용 조회로 파일 내용·DB 레코드·페이지 상태를 확인하는 단계가 필요하다. 또 차단은 끝이 아니라 대화의 일부라는 점이 중요하다. 거부 피드백을 받은 에이전트는 다른 툴 호출을 제안하고 공격자는 지시를 고쳐 오므로, 재계획된 행동마다 다시 검사해야 한다. 에이전트 런타임을 만든다면 툴 실행 훅에 게이트를 두고, 도메인별 읽기 전용 조회 도구를 붙이며, 무해 궤적 통과율과 해로운 전이 차단 시점을 함께 측정하는 평가를 준비하는 편이 좋다.

저자들이 밝힌 전제와 한계도 분명하다. SAGE는 Filesystem과 Terminal 궤적으로만 미세조정했고 PostgreSQL과 Web은 의도적으로 학습에서 제외했으며, 도메인 이전은 도메인에 맞는 읽기 전용 조사 도구를 추론 시점에 제공한다는 전제 위에서만 확인된다. RQ2의 기록 궤적 평가는 참조 정답 마감 행동이 있어야 차단 시점을 채점할 수 있고, H1·H2 같은 지표는 조기 차단에 페널티를 주는 설계다. SAGE의 조사는 질의 예산 K와 유한 정지시간 κ 안에서 이뤄지므로 예산이 성능을 좌우한다. 또한 위협 모델과 데이터·학습 세부는 부록에 위임되어 있고, 공격자 백본과 타깃 모델 구성이 특정 모델 조합에 묶여 있다는 점도 결과 해석 시 감안해야 한다.