다단계 계획의 물리적 위험을 실행 전에 잡는 PlanGuard
PlanGuard: A Guardrail for Multi-Step Plan Safety in Embodied Agents
무엇인가
체화 에이전트의 태스크 플래너는 하나의 지시를 여러 하위 작업으로 쪼개 실행한다. 문제는 각 하위 작업을 따로 보면 안전해 보여도 순서와 환경 상호작용이 결합되면 물리적 위험이 생긴다는 점이다. 논문이 드는 예에서 플래너는 먼저 가스레인지를 켜고 그다음 스토브 옆에 냅킨을 놓는 계획을 만든다. 각 단계는 초기 이미지 기준으로 안전하지만 순서대로 실행하면 냅킨에 불이 붙는다. 기존 범용 가드레일(LLaMA-Guard-4 등)은 의미적 유해성만 보고, EMBGuard 같은 체화 안전 검출기는 하위 작업을 개별적으로만 평가하기 때문에 이런 조합적 위험을 놓친다. PlanGuard는 이 공백을 겨냥해 현재 환경에서 완성된 다단계 계획 전체를 실행 전에 평가하는 최초의 검출기라고 저자들은 주장한다.
어떻게 동작하나
학습·평가용으로 MSP-Safe를 구축했다. 규모는 학습 13,692개, 테스트 1,992개 샘플이다. 구축은 세 단계다. 먼저 28개 장면과 12개 위험 유형을 조합한 336개 장면-위험 조합에 대해 Base/Risk 쌍을 만든다. Risk 과제는 지시만 바꾸는 RI(Risk-Instruction) 모드와 환경 요인만 바꾸는 RE(Risk-Environment) 모드로, 한 번에 한 가지 요인만 달라지게 통제해 인과적 위험 트리거를 학습할 수 있게 했다. 다음으로 일반 VLM(Qwen3-VL-32B-Instruct), 체화 사전학습 VLM(UnifoLM-VLM-Base), VLA(WALL-OSS-FLOW) 등 세 계열 여섯 플래너로 계획을 생성한다. 마지막으로 세 명의 이질적 심사자가 하위 작업 의존성, 계획-환경 상호작용, 시간적 발현이라는 세 축으로 각 계획을 평가하고 다수결로 Safe/Unsafe 라벨과 근거를 담은 Result-Reason 주석을 확정한다. 학습 데이터는 3,294개 이미지-지시 과제에서 나온 계획으로 안전 5,632개, 불안전 8,060개를 포함한다. 테스트는 In-Domain 500, Scene-Heldout 492, Hazard-Heldout 500, Planner-Heldout 500으로 범주 일반화를 나눠 평가한다. 주석 신뢰도 검증을 위해 무작위 1% 부분집합을 전문가 3인이 다시 주석했고, 삼자 다수결은 96.0% 일치도와 95.65% F1로 개별 심사자(89.89~91.67% F1)를 앞섰다.
무엇과 다른가
학습은 두 단계다. 1단계는 MSP-Safe에 대한 과제 지향 SFT로, Qwen3.5-0.8B·2B 소형 모델과 27B 대형 모델을 각각 미세조정한다. 모델은 중간 추론 없이 Result-Reason 구조를 바로 생성하며, Result를 앞에 두어 지연 시간을 줄이고 설명이 필요할 때만 Reason을 생성한다. 문제는 소형 모델의 성능이 SFT만으로는 27B에 못 미치는데 27B를 그대로 배포하면 추론 비용이 커진다는 것이다. 이를 메우기 위해 저자들은 STAC-OPD(Strong-Teacher Adaptive Compensation for On-Policy Distillation)를 제안한다. 첫째 구성 요소인 강교사 온폴리시 증류는 현재 학생이 생성한 궤적 위에서 동결된 SFT 교사의 다음 토큰 확률분포로 역 KL 발산을 최소화한다. 주석된 정답 토큰 하나만 알려주는 SFT와 달리 대안적 연속에 대한 교사의 상대적 선호를 전달하고, 학생이 실제 추론에서 마주칠 상태에 감독을 건다. 둘째 구성 요소인 확률 라우팅 하드 보상은 안전 결정 직전 접두사 q에서 학생이 참조 결정과 반대 결정에 부여한 확률을 비교한다. 학생이 이미 참조 결정을 선호하면 그 학생이 생성한 응답을 그대로 목표로 쓰고, 그렇지 않으면 교사가 원래 입력만 보고 완전한 응답을 재구성해 목표로 삼는다. 이렇게 라우팅된 목표에 표준 최대우도 목적함수를 적용한다. 교사 재구성 목표는 원래 주석을 보지 않고 만들어지므로 참조 라벨과 다를 수 있고, 저자들은 이 경우를 라벨 교정이 아니라 독립적으로 재구성된 교사 감독으로 취급한다.
어떻게 쓰나
실험은 A800 8장에서 ms-swift로 수행했다. PlanGuard-2B는 MSP-Safe-Test 전체에서 평균 87.15% ACC, 87.21% F1을 기록했고 PlanGuard-0.8B는 평균 F1 82.25%였다. PlanGuard-2B는 보지 못한 장면·위험·플래너 범주에서도 평균 F1 86.47%를 냈다. 베이스라인 비교에서 가장 강한 범용 VLM인 Qwen3.5-Plus 대비 0.8B·2B가 평균 F1을 각각 0.77점, 5.73점 높였다. 가장 좋은 안전 가드레일 베이스라인인 GuardTrace-VL-3B 대비로는 26.31점, 31.27점 높다. 하위 작업을 개별 평가하는 EMBGuard-2B와의 비교에서는 13.29점, 18.25점 앞섰다. 저자들은 이 격차가 의미적 콘텐츠 모더레이션만으로는 계획 실행과 환경 상호작용에서 생기는 물리적 위험을 잡을 수 없다는 증거라고 해석한다.
전제와 한계
학습 단계 소거 실험(0.8B 기준)에서 미세조정 전 베이스라인 평균 F1은 64.38%였고 과제 지향 SFT가 78.96%로 가장 큰 향상을 만들었다. 강교사 OPD가 81.47%로 올렸고 하드 보상이 0.78점을 더해 최종 82.25%가 됐다. 향상은 Scene-Heldout 0.99점, Hazard-Heldout 0.91점에서 특히 두드러졌다. 또 계획 전체를 한 번에 평가하는 Full 방식과 하위 작업을 개별 평가하는 Stepwise 방식을 비교하기 위해 50개 중립 과제에 안전 계획과 불안전 계획을 하나씩 짝지은 100개 진단 세트를 별도로 만들었다. 이 세트에서 모든 하위 작업은 개별적으로 안전해 보이지만 순서대로 실행하면 위험이 생긴다. Full 방식은 Stepwise 대비 0.8B에서 6.48점, 2B에서 15.04점 F1이 높았고 EMBGuard-2B는 향상이 없었다. Full 방식은 계획당 모델 호출이 한 번이면 된다는 비용 이점도 있다.
실무적으로 이 논문은 로봇·에이전트 파이프라인에서 플래너 출력을 실행기에 넘기기 전에 거르는 게이트로 쓸 수 있는 형태를 제시한다. 눈여겨볼 지점은 세 가지다. 첫째, 검사 대상이 단일 텍스트가 아니라 환경 이미지·지시·완성된 계획 전체라는 점이다. 둘째, Result를 Reason보다 먼저 생성하도록 학습해 결정만 필요할 때 지연을 줄이는 설계로 실시간성이 필요한 체화 배포를 겨냥한다. 셋째, 0.8B·2B급 소형 모델에서 27B 교사에 근접한 성능을 내는 증류 절차를 제시한다는 점이다. 다만 이 검출기는 실행 전, 초기 환경만 주어진 상황을 전제로 하므로 실행 중 상태 변화를 반영하는 런타임 모니터링과는 역할이 다르다. 코드와 데이터셋은 공개 예정이라고 밝혔을 뿐 본문에 저장소 주소는 제시되지 않았다.
원문에는 별도의 한계 절이 없고 전제는 본문 곳곳에 흩어져 있다. 첫째, 모든 평가가 실행 전 가정과 초기 환경만을 사용한다. 둘째, MSP-Safe는 합성 체화 과제·이미지·플래너 출력으로만 구성되며 실제 개인정보나 민감 데이터는 포함하지 않는다고 윤리 성명에서 밝힌다. 셋째, 하드 보상 단계에서 교사가 재구성한 목표는 원래 주석을 조건으로 하지 않으므로 참조 라벨과 어긋날 수 있고, 저자들은 이를 라벨 재현 제약이 아닌 독립적 교사 감독으로 취급한다. 넷째, 학습 데이터 규모가 커서 1% 부분집합만 전문가가 재검증했고 테스트셋은 전문가 전수 검토를 거쳤다는 점에서 학습 라벨의 잔여 오류 가능성은 완전히 배제되지 않는다.