워터마크 잔차 전이는 아키텍처가 좌우하고 CoverLock이 차단한다
Residual Transferability in Neural Image Watermarking
무엇인가
AI 생성 이미지가 늘면서 보이지 않는 워터마킹은 출처 증명과 책임 추적의 핵심 수단이 됐다. 구글 SynthID, 메타, 오픈AI, 아마존 등이 이미 생성 파이프라인에 워터마크를 넣었다. 문제는 잔차 기반 위조 공격이다. 공격자는 공개된 워터마크 이미지에서 워터마크가 실린 잔차를 추정해 무관한 대상 이미지에 더하기만 하면, 그 이미지가 원래와 같은 워터마크를 가진 것처럼 검증되게 만들 수 있다. 최근 연구들은 참조 이미지 한 장 또는 몇 장만으로 이 공격이 가능하다고 보고했다. 그런데 기존 연구는 더 효과적인 공격을 만드는 데 집중했을 뿐, 왜 그 잔차가 다른 이미지로 전이되는지는 제대로 설명하지 못했다.
어떻게 동작하나
이 논문은 그 물음을 잔차 전이성(RT, Residual Transferability)이라는 시스템 수준 속성으로 정식화한다. 특정 잔차 추정 기법에 결과가 좌우되지 않도록, 실제 삽입 전후의 차이로 만든 정답(GT) 잔차를 쓴다. 메시지 M개 각각에 대해 s장의 원본 이미지로 평균 잔차를 만들고, 이를 겹치지 않는 T장의 대상 이미지에 더한 뒤 디코더의 비트 정확도를 평균한다. 이 평균 정확도를 ā_s라 할 때 RT@s = max(2ā_s − 1, 0)으로 정의한다. 0은 무작위 추측 수준이고 클수록 전이가 잘 된다는 뜻이다. 기본 설정은 s=100, T=100, M=5다.
무엇과 다른가
행동 분석에서 고RT와 저RT 시스템의 차이가 뚜렷하게 갈렸다. 커버 이미지 다섯 장씩 묶어 잔차를 평균하면 커버 의존 성분이 상쇄되는데, 고RT 방법은 이미지 그룹이 달라져도 잔차 패턴이 일관되게 남았다. 즉 커버와 무관한 워터마크 성분이 강하다. 디코더의 최종 특징 추출 층에서 커버 변화와 메시지 변화가 각각 유발하는 특징 분산을 재보면, 고RT 디코더는 커버 변화의 상대적 기여가 훨씬 작았다. 중요한 건 이 차이가 학습 목적함수나 강건성 증강 같은 훈련 측 요인으로는 설명되지 않는다는 점이다. 저자들은 아키텍처 설계가 RT를 지배하는 주된 요인이라고 결론 내린다.
어떻게 쓰나
저RT 시스템 두 개를 양성 사례로 삼아 개입 실험을 하면서 두 가지 메커니즘을 분리해냈다. 첫째는 HiDDeN의 Broadcast–GAP 설계다. 임베딩 단계에서 메시지를 공간적으로 브로드캐스트해 국소 이미지 특징과 융합하고, 디코더는 늦은 전역 평균 풀링 단계까지 공간 표현을 유지한다. HiDDeN에서 이 설계를 제거하면 RT가 급격히 올라가고, 고RT 워터마크에 이식하면 RT가 크게 떨어진다. 둘째는 RivaGAN 인코더의 콘텐츠 적응형 어텐션이다. 입력 이미지에 따라 삽입 패턴을 조절하는 이 메커니즘을 고정 패턴으로 바꾸면 RT가 크게 상승한다. 훈련 역학도 이를 뒷받침한다. 고RT 구성은 적은 이미지로도 높은 디코딩 정확도에 도달하는데, 이는 커버에 의존하지 않는 지름길을 학습했기 때문으로 해석된다. 반대로 저RT 메커니즘을 가진 구성은 훨씬 많은 이미지를 봐야 수렴한다. 다만 VINE에는 Broadcast–GAP를 직접 이식하려 했으나 최적화가 이미 어려워 수렴하지 않았다.
전제와 한계
기존 시스템을 재설계하는 비용이 크기 때문에, 저자들은 CoverLock이라는 워터마크 비의존 플러그인을 함께 제안한다. 원본 메시지 m을 이미지 조건부 이진 코드 b_θ(x)와 XOR해 p = m ⊕ b_θ(x)를 만들고, 원래 인코더 E에 p를 넣는다. 검출 시에는 원래 디코더가 복원한 값을 다시 b_θ(τ(x^w))와 XOR해 m을 되돌린다. 같은 사용자 메시지가 커버 이미지에 따라 다른 페이로드로 삽입되는 구조다. 코드 생성은 동결된 DINOv2 백본의 패치 특징에서 채널별 평균과 표준편차를 뽑아 경량 프로젝터로 매핑하고 ℓ2 정규화한 뒤, 고정 직교 투영(L0=256)으로 로짓을 만든다. tanh를 거친 소프트 코드를 학습에 쓰고, 0을 기준으로 이진화한 코드를 실제 래핑에 쓴다. 학습은 MSCOCO 자연 이미지와 그 변환 뷰만으로 대조 학습을 수행하며, 워터마크 인코더·디코더나 위조 샘플은 전혀 쓰지 않는다. 여기에 이진 신뢰도 손실과 코드 정규화 항을 더한다.
실험은 고RT로 분류된 CIN, VINE, MBRS를 대상으로 DIV2K, ImageNet, MS-COCO에서 수행했다. 공격은 GT@1, 참조 100장을 쓰는 Yang et al. 방식, 참조 1장을 쓰는 WMForger를 사용했고, 비교군은 ConvNeXt 기반 이진 분류기 필터링과 미디어 해시로 검증을 이미지에 묶는 MHDW다. 검증 임계값은 모든 기법에서 FPR < 10⁻⁶으로 맞췄다. CoverLock은 모든 워터마크 시스템·데이터셋·공격 조합에서 낮은 ASR을 유지했고, 가장 높은 평균 ASR조차 0.25% 미만이었다. 반면 분류기 베이스라인은 GT 기반 위조에서 배운 잔차 흔적이 다른 추정 절차에서는 크게 달라져 공격 간 일반화가 나빴고, MHDW는 더 깨끗한 잔차를 얻는 공격에 취약해지는 공격 의존적 보호를 보였다. 강건성 분석에서는 MHDW와 CoverLock-G의 페이로드 BER이 7.4%로 같았지만, 이미지 의존 해시 성분의 BER을 CoverLock-G가 14.6%에서 4.2%로 낮춰 최종 BER이 크게 개선됐다. 즉 강건성 이점은 페이로드 복원이 아니라 이미지 의존 성분의 안정적 복원에서 온다. MBRS와 COCO 조합에서 CoverLock 변형들은 낮은 ASR과 높은 TPR 영역에 몰려 있었고, DINOv2 백본을 Small에서 Giant로 키우면 TPR을 약 92%로 유지하면서 ASR이 더 낮아졌다.
실무에서는 두 갈래로 쓸 수 있다. 새 워터마킹 시스템을 설계한다면 메시지를 국소 이미지 특징과 공간적으로 융합하고 디코더가 공간 표현을 늦게까지 유지하게 하거나, 이미지에 따라 삽입 패턴을 적응시키는 쪽이 위조 저항에 유리하다. 이미 배포된 시스템이 있다면 CoverLock을 래퍼로 붙이는 편이 현실적이다. 다만 도입 전에 위협 모델을 자기 서비스에 맞춰 확인해야 한다. 이 논문의 위협 모델은 공격자가 같은 메시지를 담은 공개 워터마크 이미지 한 장에서 몇 장을 확보하고, 사용된 워터마크 기법과 방어 기법을 모르며, 인코더·디코더 파라미터에 접근할 수 없고 인코더를 질의해 추가 워터마크 이미지를 만들 수도 없다는 전제 위에 있다. DINOv2 백본 크기, 검증 임계값(FPR < 10⁻⁶), 그리고 보안과 강건성 사이의 트레이드오프 곡선에서 어느 지점을 감수할지도 함께 정해야 한다.
저자들이 밝힌 범위와 한계도 분명하다. 대규모 워터마크 이미지 컬렉션을 가정하는 Dong et al.의 공격은 이 논문의 소수샷 위협 모델 밖이라 다루지 않는다. 논문은 모델에 독립적이고 배포가 쉬운 후처리 방식에 초점을 맞추며, 생성 과정에 직접 워터마크를 넣는 in-generation 방식은 대상이 아니다. 아키텍처 재설계는 방법마다 다르고 비용이 크며, VINE처럼 이미 최적화가 어려운 모델에는 Broadcast–GAP 이식이 안정적으로 수렴하지 않았다. CoverLock 구현은 공개 예정이라고 밝혔을 뿐 원문에 저장소 URL은 제시되지 않았다.