AI 워터마킹이 SynthID로 유해 요청 거부율을 바꿔 모델 안전성을 흔든다

Ars Technica23일 전조회 4

AI 생성물 표시(워터마킹)가 모델의 안전 동작 자체를 바꿀 수 있다는 연구 결과가 나왔다. 구글이 오픈소스로 공개한 SynthID-Text를 적용하면 모델이 다음 단어를 고르는 방식뿐 아니라, 어떤 도구를 호출하는지와 학습된 안전 가드레일을 지킬지 여부까지 달라진다는 것이다. Anthropic이 향후 Claude 모델에 이 기법을 도입하겠다고 예고한 상황이라 파장이 작지 않다.

SynthID-Text의 동작 원리는 이렇다. 문장의 다음 토큰을 뽑을 때 임의의 난수 생성기를 쓰는 대신 비밀 키를 사용한다. 후보 토큰 다수에 키 기반 확률 점수를 매기고, 토너먼트 방식으로 후보를 짝지어 비교해 최종 토큰을 정한다. 단어 선택은 여전히 무작위지만, 키를 가진 쪽은 단어열을 검사해 해당 플랫폼이 만든 텍스트일 가능성을 판별할 수 있다. 독자 눈에는 드러나지 않게 출처를 증명하는 구조다.

Lasso Security의 AI 보안 연구원 Andrea Siposova는 Hugging Face가 제공하는 수정되지 않은 SynthIDTextWatermarkLogitsProcessor를 통해 SynthID-Text의 '비왜곡(non-distortionary)' 설정을 실험했다. 오픈 웨이트 모델 6종에 유해 프롬프트를 넣고, 워터마킹을 켠 경우와 끈 경우의 응답을 비교하는 방식이었다.

결과는 워터마킹이 유해 요청에 대한 거부 행동을 바꿔놓았다는 것이다. 특히 같은 요청을 프롬프트 인젝션 기법과 결합했을 때 그 효과가 더 뚜렷했다. 여러 모델에서 워터마킹이 적용되면, 평소라면 거부했을 유해 요청에 응답할 가능성이 오히려 높아졌다.

문제는 응답 문장에 그치지 않는다. 에이전트가 모델을 통해 행동할 때, 동일하게 샘플링된 토큰이 어떤 도구를 호출하고 어떤 인자를 넘길지를 결정한다. 거부가 약해진 상태에서 도구 실행 권한까지 있으면 결과는 훨씬 무거워진다. 연구진은 이렇게 워터마킹 절차가 모델이 말하는 것과 에이전트가 하는 것을 동시에 흔드는 현상을 '샘플링 드리프트(sampling drift)'라고 부른다. 도구 호출의 개별 정확도도 달라졌는데, 전체 정확도 점수만으로는 드러나지 않는 정답→오류, 오류→정답 전환이 섞여 있었다.

비밀 키 자체도 변수다. 어떤 키를 쓰느냐에 따라 모델 행동이 달라졌고, 실험에 사용한 키 외에 추가로 살펴본 10개 키에서는 유해 요청 순응도가 증가하는 방향과 감소하는 방향으로 갈렸다.

배경에는 유럽연합의 새 법규가 있다. AI 플랫폼들이 생성 콘텐츠에 워터마킹을 붙이는 제도를 속속 도입하고 있고, Anthropic의 Claude도 그 흐름에 올라탔다. 워터마킹은 읽는 사람이 알아채지 못하도록 설계되지만, 생성 과정을 조금이라도 건드리는 이상 어딘가에 트레이드오프가 나타날 수밖에 없다는 것이 연구진의 지적이다.

개발자 입장에서 달라지는 것은 검증의 범위다. 워터마킹을 켠 상태에서 프롬프트 인젝션과 도구 호출 시나리오를 포함한 레드팀 스트레스 테스트를 돌려, 배포 환경에서 기대한 대로 동작하는지 확인해야 한다. 워터마킹을 끈 상태의 벤치마크만으로 안전성을 판단하면 실제 서비스 동작과 어긋날 수 있다.

다만 이번 연구가 Claude 모델 자체를 대상으로 한 것은 아니다. 오픈 웨이트 모델 6종을 대상으로, 다른 설정을 고정한 채 토큰 샘플링을 켜고 끌 수 있는 환경에서 실험했다는 점도 전제다. 또한 Claude가 실제로 사용할 구현이 아니라 Hugging Face 쪽 SynthID-Text 토너먼트 샘플링 구현을 테스트한 결과라는 한계가 있다. 그럼에도 최소한 일부 형태의 워터마킹 접근이 모델과 에이전트 안전성에 영향을 줄 수 있다는 점은 확인됐다.

관련 글