InGuard는 생성 파이프라인 내부 표현으로 T2I 안전성을 높인다.

InGuard: Towards Generalized Inner Guardrail for Safe Text-to-Image Generation

arXiv2609.27620v1

Zeyu Wang2026-09-23조회 10

무엇인가

이 논문은 오픈웨이트 텍스트-이미지 모델이 고품질 이미지를 만들 수 있지만 NSFW와 통제 IP 캐릭터 생성 위험도 함께 키운다는 문제를 다룬다. 기존 외부 가드레일은 생성 전 프롬프트 분류기와 생성 후 이미지 분류기로 구성되는데, 두 분류기가 생성 파이프라인 밖에서 동작하고 모델 자체 표현을 쓰지 않는다. 그래서 프롬프트 검사 정확도가 제한되고, 이미지 검사는 전체 디노이징 비용을 다 쓴 뒤에야 실행되며, 위험 프롬프트는 안전한 이미지로 조정될 수 있어도 곧바로 거부된다. 저자들은 이 세 한계의 뿌리를 가드레일이 모델의 임베딩과 중간 특징을 보지 못하는 데 있다고 보고, 베이스 모델 파라미터를 건드리지 않는 파이프라인 내부 안전 프레임워크 InGuard를 제안한다.

어떻게 동작하나

첫 구성 요소는 프롬프트 임베딩 위험 분류기 PE-MLP다. 외부 언어모델 없이 T2I 모델 자체 텍스트 인코더의 출력 임베딩을 사용해 프롬프트를 포르노, 고어, 통제 IP의 세 축으로 평가한다. 어텐션 마스크가 있으면 마스킹 평균 풀링을, 없으면 단순 평균 풀링을 적용해 e_bar = sum_i m_i e_i / sum_i m_i를 만들고, 공유 백본과 세 개의 독립 헤드를 가진 멀티태스크 MLP가 RevGen Safety Benchmark의 프롬프트 임베딩으로 멀티태스크 교차엔트로피 학습을 한다. 예측 등급에 따라 위험도가 높은 프롬프트는 생성 전 차단되고, 위험군은 SAGE로 보내지며, 정상 프롬프트는 그대로 통과한다. 포르노·고어는 LDM별 차단 임계값을 쓰고, 통제 IP 위험만으로는 직접 차단하지 않으며, 강화 대상은 포르노 3 이상, 고어 2 이상, IP 1~5 구간이다.

무엇과 다른가

두 번째는 SAGE, 즉 Soft-gated Asymmetric Guardrail for Embeddings다. 위험 프롬프트를 거부하는 대신 임베딩 공간에서 독성 개념을 줄여 안전한 이미지를 얻으려 한다. 34개의 안전 관련 개념을 영어와 중국어로 정의하고, 개념 임베딩 행렬 C로 P_C = C(C^T C)^-1 C^T를 만들어 (I-P_C)가 선택된 개념 방향을 제거하도록 한다. 라벨 게이팅으로 포르노 등급이 0이 아니면 13개 포르노 개념을, 고어 등급이 0이 아니면 11개 고어 개념을, IP 등급이 1~5면 해당 캐릭터 개념 벡터만 선택한다. 트리거 토큰 탐지는 각 사용자 콘텐츠 토큰을 하나씩 바꿔 다시 인코딩하는 leave-one-out 방식으로 수행한다. 마스킹된 프롬프트의 잔차 거리 d_i = ||(I-P_C) p_{제외 i}||를 구하고 r_i = d_i / mean({d_j}_{j≠i})로 정규화한다. 또한 leave-one-out 임베딩으로 문맥 부분공간 P_ctx를 만들어 p_hat_i = (I-P_C) P_ctx p_i로 토큰의 문맥 역할은 유지하면서 독성 개념 성분을 제거한다. 이진 트리거 규칙 r_i > 1+alpha 대신 delta_i = r_i - (1+alpha)를 사용하는 연속적이고 비대칭적인 소프트 게이트 블렌딩으로 경계 부근의 과소·과잉 제거를 줄인다. 구조 토큰은 변경하지 않는다.

어떻게 쓰나

세 번째는 잠재 공간 안전 검출기다. 디노이징 중간 단계에서 한 스텝 깨끗한 잠재 추정값을 검사해 남은 위험을 잡고, 위험이 감지되면 생성을 중단한다. 자연 RGB가 아닌 C채널 잠재 입력을 받도록 ImageNet 사전학습 백본의 입력 스템을 바꾸고, Phase A 특징 증류로 잠재 도메인에 적응시킨 뒤 안전 미세조정을 한다. 배포 단계는 Z-Image-Turbo 3스텝, 10스텝 모델 세 개는 4스텝, InternVL-U는 8스텝이며, 이 지점에서 잠재 검출기의 평균 F1은 이미지 수준 검출과 0.26~1.71% 차이에 불과하다. 여기서 차단되면 디노이징 평가의 50~55.6%를 건너뛴다. 증류 사전학습은 모든 풀 크기에서 평균 F1을 올렸고 50K에서 0.32~1.00% 향상, 5K에서는 Z-Image-Turbo가 3.55% 향상 대 50K에서 0.82% 향상을 보였다. 5K 사전학습 검출기는 90.18% 평균 F1로 20K 무증류 기준 90.33%에 근접해 4배 작은 미세조정 풀을 썼다. 사전학습 데이터 생성은 미세조정 데이터 생성보다 48~139배 빠르며, VAE 인코더는 H20-3e bf16 배치 1에서 샘플당 약 100~400ms, 전체 디노이징은 샘플당 약 5~28초다.

전제와 한계

평가용으로 RevGen Safety Benchmark를 새로 만든다. 실제 이미지를 VLM으로 역생성해 만든 1만 개 프롬프트로, 영어와 중국어를 포함하고 일부는 IP 캐릭터 재작성 단계를 거친다. 포르노, 고어, 통제 IP 세 위험 축과 포르노·고어의 세분화된 심각도, IP의 범주형 라벨, 경계 근처 정상 네거티브를 포함한다. 통제 IP는 Snow White, Doraemon, Minions, Elsa, SpongeBob SquarePants 다섯 캐릭터이며 단일·다중 캐릭터 장면을 다룬다. 정상 IP 변형은 비통제 저작권 캐릭터인 Luffy, Conan, 같은 프랜차이즈의 조연인 Nobita, Patrick Star, 그리고 Doraemon과 시각적으로 비슷하지만 원본은 아닌 귀 없는 파란 로봇 동물 같은 룩얼라이크다. 재현율은 다섯 통제 캐릭터에서만 측정하고 정상 하위 범주는 오탐을 본다. 생성 이미지 다양성은 DINOv2 ViT-B/14 CLS 특징의 Vendi Score로 측정했고, RevGen은 다섯 모델 중 세 모델에서 최고 다양성을 보여 FLUX.2-klein-base-9B 79.72, Qwen-Image-2512 58.80, InternVL-U 52.97을 기록했다. 위험 유발률은 위험 프롬프트에서 21.60~94.00%, 정상 하위 범주에서는 3.20%를 넘지 않았다. 포르노 범주 교차 벤치마크에서는 다섯 모델 중 네 모델에서 RevGen이 가장 높았고, FLUX.2-klein-base-9B에서는 Ring-A-Bell이 52.78%로 RevGen 30.50%보다 높았다.

실험은 Z-Image-Turbo, Qwen-Image-2512, HunyuanImage-2.1, FLUX.2-klein-base-9B, InternVL-U 다섯 오픈웨이트 T2I 모델에서 수행한다. 외부 가드레일은 mE5-base 또는 mBERT-cased 텍스트 분류기와 ConvNeXt-Base 이미지 분류기로, 내부 가드레일은 PE-MLP, SAGE, 잠재 검출기로 구성한다. SAGE의 주 베이스라인은 SAFREE다. PE-MLP는 모든 위험 축과 다섯 LDM에서 외부 텍스트 분류기보다 높은 성능을 보였고, 외부 분류기보다 10배 이상 적은 파라미터를 쓰면서 프롬프트 측 오탐도 낮았다. SAGE는 SAFREE보다 강화 성공률을 8.5~24.9% 높이고 정상 교란을 1.1~5.1% 줄였다. InternVL-U에서는 성공률이 54.1% 대 29.2%로 거의 두 배였고 교란은 1.2% 대 2.6%로 더 낮았다. 시스템 수준에서 InGuard는 안전률 97.9~98.8%로 외부 가드레일과 같거나 0.00~1.57% 높았고, 정상 교란은 9.3~10.6%에서 2.6~4.5%로 떨어져 상대적으로 57.5~73.5% 감소했다. 추가 가드레일 파라미터는 약 100M 대 370.6M으로 약 3.7배 적다. PE-MLP는 LDM 자체 텍스트 인코더를 재사용하고 5.8~15.8M MLP만 추가하는 반면, 외부 mE5 분류기는 약 282M을 요구한다. 중간 단계에서 차단된 요청은 디노이징 스텝의 50~55.6%를 건너뛴다.

개발자 관점에서 InGuard는 오픈웨이트 T2I 서비스에 안전 계층을 넣을 때 참고할 만한 설계다. 베이스 모델 파라미터를 바꾸지 않고 텍스트 인코딩과 반복 생성 단계에 플러그인처럼 붙이며, 프롬프트 임베딩 분류로 위험을 등급화하고 위험군만 임베딩 공간에서 완화한 뒤 중간 잠재 검출로 잔여 위험을 잡는다. 외부 이미지 분류기처럼 전체 생성을 끝낸 뒤 버리는 비용을 줄이고, 정상 프롬프트 교란도 낮추는 것을 목표로 한다. 실제 도입 시에는 LDM별 차단 임계값, 34개 개념 집합의 언어·정책 커버리지, 텍스트 인코더와 잠재 검출기 입력 채널 호환성, IP 정책에서 다중 캐릭터 장면을 어떻게 처리하는지 확인해야 한다. 논문이 보고한 디노이징 스텝 절감은 텍스트 인코딩, SAGE의 마스킹 재인코딩과 투영, 분류기 추론, VAE 디코딩을 제외한 값이므로 실제 지연시간이나 평균 서빙 비용 감소로 바로 해석하면 안 된다.

저자들이 밝힌 한계도 분명하다. SAGE의 라벨 게이팅은 프롬프트 분류기 정확도와 유한한 개념 집합에 묶여 있어 적대적 재작성과 다중 캐릭터 IP 장면에 더 강건하게 만드는 일이 다음 과제다. 단일 라벨 IP 헤드는 프롬프트당 통제 캐릭터 하나만 선택하므로 다중 캐릭터 장면의 모든 통제 캐릭터를 명시적으로 표현하지 못한다. 평가는 포르노, 고어, IP 세 범주만 다루며 증오와 프라이버시 같은 다른 정책 차원은 남아 있다. 검출은 한 스텝 잠재 추정값에 의존하므로 보지 못한 생성기, 비디오 생성, 다른 반복 합성 과정으로 확장해야 한다. 또한 평균 F1이 높다고 모든 지표가 좋아지는 것은 아니며 특정 운영점에서 재현율이나 정상 교란이 나빠질 수 있다. 데이터 생성 속도 비율은 샘플 준비 비용만 측정한 것이고 검출기 학습이나 전체 가드레일 추론 비용이 아니며, 시스템 비교도 각 구성 요소의 개별 인과 기여를 분리하지 않는다.

관련 논문