실제 이미지만으로 AI 생성 이미지를 잡는 자기지도 잔차 학습, Forensic Twins

Forensic Twins: Self-Supervised Residual Learning for AI-Generated Image Forensics

arXiv2609.31514v1

Javier Muñoz-Haro2026-09-25조회 2

무엇인가

AI 생성 이미지 탐지기는 보통 자기가 잡아야 할 모든 생성 아키텍처의 샘플로 학습된다. 그래서 새로운 생성 모델이 등장하면 곧바로 성능이 무너진다. 자기지도 사전학습이 대안으로 연구돼 왔지만, 표준 SSL 프레임워크는 포렌식 과제와 정면으로 충돌한다. 리사이즈·블러·재압축 같은 증강이 이미지 형성 과정의 미세 통계, 즉 탐지에 써야 할 바로 그 신호를 덮어써 버리기 때문이다. 이 논문은 AI 생성 이미지를 단 한 장도 보지 않고 실제 이미지만으로 학습하는 자기지도 잔차 학습(SSRL) 프레임워크 Forensic Twins를 제안한다.

어떻게 동작하나

구조는 이렇다. 입력 RGB 이미지를 회색조로 바꾸고 [0,1]로 정규화한 뒤, Nguyen 등(2025)이 제안한 학습된 포렌식 잔차 추출기(FRE)에 통과시킨다. 이 추출기는 동결된 상태로 쓰이며 H×W×8 크기의 잔차 텐서를 만든다. 여기서 핵심은 두 개의 뷰를 만드는 방식이다. 표준 SSL처럼 겹치는 크롭을 쓰지 않고, 공간적으로 전혀 겹치지 않는 두 크롭을 뽑아 두 뷰로 삼는다. 픽셀을 하나도 공유하지 않으므로 두 뷰가 정렬할 수 있는 의미 구조가 거의 남지 않는다. 그런데도 두 크롭이 공유하는 지배적 신호가 하나 남는데, 그것이 이미지 획득 파이프라인이 이미지 평면 전체에 균일하게 뿌린 정상(stationary) 지문이다. 저자들은 이 미세 통계를 목적함수가 붙잡을 수 있는 유일한 요인으로 만드는 것이 설계 원리라고 설명한다.

무엇과 다른가

목적함수는 Barlow Twins의 중복 감소 원리를 따른다. 배치 단위로 두 뷰의 임베딩 사이 상호상관 행렬을 계산하고, 대각 원소는 1로(불변성), 비대각 원소는 0으로(중복 제거) 몰아간다. 음성 샘플이 필요 없다. 증강은 90도·180도·270도 직교 회전과 상하좌우 뒤집기만 허용하며, 이마저도 이미지당 한 번 뽑아 두 뷰가 공유한다. 즉 두 뷰를 구분하는 요인은 어디를 잘라냈는가 하나뿐이다. 인코더는 3.0M 파라미터의 ViT-Tiny이고, 크롭 크기가 매 반복 임의로 바뀌므로 2D rotary positional embedding을 써서 한 벌의 가중치로 임의 크기를 처리한다. 프로젝터 출력 차원은 8192다. 학습 데이터는 ImageNet-1k에서 25만 장, MS-COCO에서 24만1690장을 모은 실제 이미지 49만1690장이며, 어떤 단계에서도 AI 생성 이미지는 등장하지 않는다. 학습은 RTX 4090 4장에서 80 에폭, AdamW, 학습률 0.0015, 배치 320으로 이뤄졌다.

어떻게 쓰나

탐지 과제에서는 사전학습된 인코더를 고정하고 프로젝터를 버린 뒤, 실제 이미지 임베딩에만 가우시안 혼합 모델(GMM, K=1, 완전 공분산)을 오프라인으로 적합시킨다. 테스트 이미지의 음의 로그 우도를 이상 점수로 삼아 실제/AI를 가르는 방식이다. 결과는 27개 미학습 생성기(GAN 계열, 확산 모델, 상용 시스템 포함)에 걸쳐 평균 AUC 97.99%다. 비교한 9개 방법 중 3위이면서 1위와 1% 이내다. 다만 조건이 다르다. EFFORT는 504.6M 파라미터 백본을 AI 생성 이미지로 지도학습해 0.97% 앞서고, OmniAID는 같은 방식의 508.8M MoE로 0.32% 뒤진다. FSD는 98.52%로 조금 더 높지만 이미지 한 장당 2415.27ms가 걸리는 반면 Forensic Twins는 6.44ms로, 375배 빠르다. 실제 이미지만 쓰는 방법끼리 비교하면 ConV(77.13% AUC, 304.4M 파라미터)를 21%p 앞서면서 백본은 두 자릿수 배 작다. 카테고리별 편차도 눈에 띈다. 상용 생성기에서 96.10%로 가장 낮지만 FSD의 93.72%보다 2.38%p 높고, 최고-최저 카테고리 격차가 2.46%p에 불과하다. 반면 NPR은 확산 모델 94.45%에서 상용 74.50%로 떨어지고, CNNDet·LGrad·UFD는 각각 28.17%p, 24.56%p, 14.13%p 벌어진다.

전제와 한계

두 번째 과제는 이미지 출처 군집화다. 실제 이미지와 여러 AI 생성 이미지를 섞은 표현에 k-Means를 바로 적용해 소스를 묶는다. 진짜 소스 수 N을 기준으로 k=N일 때 정확도 56.61%로 이전 최고 zero-shot 방법보다 6.13%p 높고, k=2N에서 17.12%p, k=4N에서 10.76%p 앞선다. DINOv2 표현을 쓰는 ConV는 k=N에서 43.98%, CLIP 비전 인코더는 51.73%에 그친다. t-SNE 시각화에서도 표현 공간은 ImageNet 의미 슈퍼클래스가 아니라 생성기 정체성 기준으로 정리되는데, 저자들은 이것이 표현이 의미론이 아닌 이미지 형성 구조에 지배된다는 증거라고 본다.

절제 실험은 설계 선택 하나하나의 값을 보여준다. RGB 원본을 그대로 넣은 기준선은 AUC 60.95%로 GAN에서 사실상 찍기(51.76%) 수준이었다. 잔차 추출기를 앞에 두면 고정 SRM 필터로 84.14%, 학습된 FRE로 93.77%까지 오른다. 즉 특정 필터가 아니라 콘텐츠를 억제하는 것 자체가 탐지를 가능하게 한다. 겹치는 크롭으로 바꾸면 89.49%로 4.28%p 떨어지고, DINOv2식 파괴적 증강을 쓰면 57.84%로 35.93%p 폭락한다. 패치 크기를 8로 줄이면 1.70%p 이득, 컨볼루션 스템은 단독으로는 1.37%p 손해다. GAP 요약은 2.67%p 손실이고, 잔차의 정상성을 반영해 토큰별 표준편차를 이어 붙이는 시도는 1.07%p를 되찾지만 기준선보다 1.60%p 낮다. 중복 제거 항의 가중치 λ는 방향이 아니라 최적점이 있어서, 패치 8에서는 5×10⁻⁵에서 97.99%를 찍는다. 최종 구성은 FRE 기준선 대비 4.22%p AUC를 끌어올린다.

개발자 관점에서 이 논문의 실용적 가치는 비용 구조에 있다. 3.0M 파라미터, 단일 포워드 패스 6.44ms면 서버 GPU 없이도 배치 파이프라인이나 엣지에서 돌릴 수 있는 규모다. 또 새 생성 모델이 나올 때마다 탐지기를 재학습하는 대신, 실제 이미지 분포만 정의해 두고 거기서 벗어나는 것을 이상으로 잡는 운영 방식이 가능하다는 것을 보여준다. 도입 전에 확인할 것은 추론 조건이다. 평가는 256×256 센터 크롭 기준이므로 원본 해상도와 크롭 정책이 다르면 성능이 달라질 수 있고, 재압축이나 후처리가 들어간 이미지에서 GMM 기반 이상 점수가 얼마나 버티는지도 따로 봐야 한다. 상용 생성기 계열이 가장 약한 구간이라는 점도 감안해야 한다.

저자들이 직접 밝힌 한계도 분명하다. 첫째, 상용 아키텍처는 거의 모든 방법에서 가장 약한 계열이며 Forensic Twins도 마찬가지다. 기술이 공개되지 않아 어떤 모듈이 활용 가능한 흔적을 남기는지 짚기 어렵기 때문이다. 둘째, one-class 밀도 추정 자체의 한계로, 부록 A에서 재압축에 대한 GMM의 강건성이 떨어지는 것이 확인된다. 다만 소량의 라벨 예시만 있으면 성능이 상당 부분 회복되어, few-shot 보정이 zero-shot 설정의 자연스러운 보완이 될 수 있다고 저자들은 본다. 향후 계획으로는 dense ViT 특징을 활용하는 목적함수 설계와 Normalizing Flows 같은 대안적 one-class 모델링을 제시한다.