잠재 공간 통신 링크만 조작해도 안전 정렬된 멀티에이전트가 유해 요청에 응한다

Safety of Latent Communication in Multi-Agent Systems

HF Daily2609.39788

Muhammad Huzaifa, Sina Mavali, Thorsten Eisenhofer2026-09-30

무엇인가

이 논문은 멀티에이전트 시스템의 통신 방식이 안전성에 어떤 영향을 주는지 다룬다. LLM 에이전트들은 보통 자연어 텍스트를 주고받는데, 이 방식은 메시지를 생성하는 쪽과 다시 처리하는 쪽 모두에서 토큰·연산·지연 비용을 발생시킨다. 잠재 통신(latent communication)은 이 비용을 줄이기 위해 텍스트 대신 송신 에이전트의 내부 표현을 직접 넘긴다. 서로 다른 표현 공간을 연결하기 위해 경량 학습 가능 링크가 도입되며, 이 링크만 학습시키고 기반 모델은 고정한다. 논문의 핵심 주장은 바로 여기에 있다. 링크 학습은 모델 파라미터를 바꾸지 않지만 수신 에이전트가 받는 입력을 바꾸기 때문에, 시스템 전체의 행동을 바꾼다.

어떻게 동작하나

방법의 구조는 다음과 같다. 송신 에이전트의 내부 표현 h_s(q)를 링크 f_θ가 잠재 입력 z_θ(q)로 매핑하고, 수신 에이전트는 원래 질의 q와 이 잠재 입력을 함께 받아 응답 y를 생성한다. 즉 z_θ(q)=f_θ(h_s(q)), y~p_φr(·|q, z_θ(q))이며, 링크 파라미터 θ만 학습되고 에이전트 파라미터 φ는 동결된다. 정상적인 링크 학습은 깨끗한 질의-응답 쌍에 대해 수신 모델의 정답 로그확률을 최대화하는 음의 로그우도 최소화로 이루어진다. 실험은 세 가지 통신 토폴로지에서 진행된다. 두 에이전트 시스템(Llama-3.2-3B-Instruct와 Qwen2.5-3B-Instruct), 순차 토폴로지(Gemma-3-1B-IT, Llama-3.2-1B-Instruct, Qwen3-1.7B), 그리고 전문가 두 개(Qwen2.5-Math-1.5B-Instruct, Qwen3-1.7B)와 요약자(Qwen3-8B)로 구성된 혼합 시스템이다.

무엇과 다른가

가장 눈에 띄는 결과는 공격 없이 정상 데이터로만 링크를 학습시켰을 때 나타난다. 모든 에이전트 파라미터가 고정된 상태에서도 유해 요청 응답률(aggregate harmful-compliance)이 두 에이전트 시스템에서 4.4에서 31.1로, 순차 시스템에서 3.2에서 31.7로, 혼합 시스템에서 12.5에서 20.8로 상승했다. 원인 분석으로 저자들은 수신 모델의 거부 반응 시작 확률을 측정했는데, 수신 모델 단독 0.82, 텍스트 통신 0.84에서 학습된 링크를 쓰면 0.29로 떨어진다. 생성 첫 토큰을 I, No, Sorry로 강제하면 응답률이 31.1에서 각각 9.6, 3.7, 1.6으로 내려가고 5토큰 거부 접두사를 넣으면 0이 된다. 저자들은 이를 얕은 안전 정렬(shallow safety alignment)과 연결 지어, 정상 지도 학습이 과제 완수만 보상하고 거부 행동을 유지할 신호를 주지 않기 때문이라고 설명한다.

어떻게 쓰나

공격은 세 갈래다. 첫째, PKU-SafeRLHF의 유해 질의-응답 쌍 3,000개로 링크를 직접 지도 최적화하면 평균 응답률이 27.9에서 75.6으로 오르지만 MATH500 정확도가 67.2%에서 30.7%로, GPQA-Diamond가 36.4%에서 28.5%로 떨어진다. 둘째, 정상 학습 데이터 1,904개에 유해 쌍 212개를 섞는 약 10% 데이터 오염만으로도 응답률이 58.2까지 오르며, MATH500은 46.7%, GPQA-Diamond는 32.5%가 된다. 셋째, 유해 목표 응답이 전혀 필요 없는 보상 기반 공격이다. GRPO로 링크를 최적화하되 LLM 판정 점수에 라틴 문자 비율과 질의 내용어 중복도 보조 항을 더한 공격 보상을 쓰고, 정상 질의에는 별도 유틸리티 판정 보상을 준다. 이 방식은 평균 응답률을 27.9에서 76.9로 끌어올리면서 MATH500 정확도를 71.0%로 오히려 높였고, 두 토폴로지에서 지도 최적화보다 높은 응답률을 기록했다(두 에이전트 81.3 대 78.3, 혼합 95.9 대 81.6). 혼합 시스템은 유해 응답률과 정상 벤치마크 정확도를 동시에 높인 사례다.

전제와 한계

링크 하나만 조작해도 충분하다. 순차 시스템에서 Refiner→Solver 링크만 최적화하면 평균 응답률 70.0으로 두 링크를 모두 최적화한 67.0과 비슷하거나 더 높았고, 혼합 시스템에서 전문가 링크 하나만 건드려도 80.3으로 전체 링크 공격의 81.6에 근접했다. 방어 측면에서는 같은 GRPO 절차를 뒤집어, 유해 질의에는 판정 점수와 거부 접두사 휴리스틱으로 벌점을 주고 정상 질의에는 정답·형식 부분 점수를 주는 안전 보상으로 링크를 수리한다. 9개 공격-토폴로지 조합 평균 응답률이 70.3에서 4.8로 떨어지고, 혼합 시스템의 보상 기반 공격 후 95.9는 2.5까지 내려간다. 에이전트는 전혀 수정하지 않는다.

개발자 관점에서 이 논문이 주는 실무적 메시지는 분명하다. 에이전트 각각을 안전 정렬해 두었다는 사실은 시스템 전체의 안전을 보장하지 않는다. 에이전트 간 인터페이스, 특히 학습되는 통신 링크는 별도의 공격 표면이며, 정상 데이터로만 학습해도 안전성이 나빠질 수 있다. 멀티에이전트 파이프라인을 배포할 때는 링크 학습 데이터의 출처와 오염 여부를 관리하고, 링크 학습 후 유해 요청 응답률을 별도로 측정해야 한다. 또한 정상 과제 성능이 유지되거나 향상되었다는 사실을 안전성의 증거로 삼아서는 안 된다.

저자들이 밝힌 한계와 전제도 있다. 수리 절차는 유해 응답률을 크게 낮추지만 보상 기반 공격으로 손상된 세 토폴로지 모두에서 MATH500 정확도를 떨어뜨렸고, 평균 GPQA-Diamond 정확도 33.6%는 깨끗한 링크 기준선 36.4%보다 낮게 남는다. 즉 안전 수리는 유틸리티 비용을 동반할 수 있으며, 공격 후에도 유틸리티가 높았던 설정에서도 그렇다. 또한 거부 시작 확률 하락을 얕은 안전 정렬로 설명하는 부분은 저자들이 "가능한 설명 중 하나"로 제시한 가설이며, 실험은 특정 소형 모델 조합과 세 토폴로지, 네 개 안전 벤치마크(HarmBench, StrongREJECT, AdvBench, JailbreakBench)와 두 유틸리티 벤치마크(MATH500, GPQA-Diamond)에 한정된다.