딥마인드가 AI 생성 단백질에 검증 가능한 워터마크를 심는다
구글 딥마인드가 합성생물학을 겨냥한 워터마킹 기술 SynthID Bio를 공개했다. AI가 만들어낸 단백질 서열과 예측 3D 구조에 눈에 띄지 않는 서명을 심어, 디지털 모델 위에서뿐 아니라 실제로 합성된 물리적 단백질에서도 출처를 확인할 수 있게 하는 것이 목표다. 회사 측은 실험실 검증에서 이 워터마크가 단백질의 생물학적 기능을 훼손하지 않았다고 전했다.
삽입 방식은 데이터 종류에 따라 달라진다. 아미노산 서열 단계에서는 아미노산 선택을 미세하게 유도하고, 예측된 3D 구조에서는 원자 좌표를 조정해 탐지 가능한 신호를 남긴다. 단백질 바인더 검증에는 바인더 설계 도구 AlphaProteo와 SynthID Bio 기능을 넣은 ProteinMPNN이 함께 쓰였다. VEGF-A, SARS-CoV-2 스파이크 단백질 RBD, PD-L1 등 세 가지 타깃에 대한 습식 실험에서 워터마크가 들어간 설계는 적중률과 결합 친화도(KD), 자연 서열 다양성 면에서 워터마크 없는 버전과 같은 수준을 기록했다. 기능을 유지한 워터마크 단백질 바인더가 만들어진 것은 이번이 처음이다.
단백질 접힘 예측에서는 AlphaFold 3 확산 네트워크의 일부를 파인튜닝해 워터마크 생성 능력을 모델 가중치 자체에 심었다. 이렇게 하면 누가 모델을 실행하든 예측된 3D 좌표에 탐지 가능한 서명이 따라붙는다. 예측 정확도를 유지하면서 탐지율은 거의 완벽한 수준이고, 주요 구조 특징 분포도 그대로 보존되며 디지털 노이즈나 소폭의 좌표 변화에도 견딘다고 한다. 논문에는 7PPA를 대상으로 한 예측 구조, 실제 구조, 워터마크 구조 비교가 함께 실렸다.
배경에는 생성 AI가 생물학 설계 영역으로 빠르게 확장하는 상황이 있다. 단백질 구조 예측의 AlphaFold, 신규 단백질 설계의 AlphaProteo와 ProteinMPNN, 최근에는 박테리아를 감염시키는 박테리오파지 설계까지 등장했다. 문제는 이런 도구가 기존 DNA 합성 스크리닝을 우회할 수 있는 설계를 만들어낼 수 있고, 라벨이 잘못 붙은 합성 3D 구조가 공공 데이터베이스를 오염시켜 후속 연구를 잘못 이끌 수 있다는 점이다.
생물보안은 여러 독립적 안전장치가 서로의 사각지대를 메우는 계층 방어 구조에 의존한다. 그중 DNA 합성 스크리닝은 최전선에 있다. 디지털 단백질 설계를 실제 분자로 만들려면 합성 업체에 주문을 넣어야 하고, 업체는 알려진 위협 데이터베이스와 대조해 요청을 검사한다. 과거에는 낯선 서열을 미발견 자연 유기체로 가정할 수 있었지만, AI가 기존 위협과 유사성이 거의 없는 서열을 만들어내면서 그 가정이 통하지 않게 됐다. 낯선 주문이 엔지니어링된 위협인지 확인하려면 수작업 검토가 필요하고, 이 과정에서 연구가 지연될 수 있다. SynthID Bio는 신뢰할 수 있는 모델에서 나온 주문임을 증명하는 자동 검증 신호로 쓰일 수 있다. Twist Bioscience의 정책·생물보안 담당 부사장 James Diggans는 이 접근이 스크리닝을 강화하고 자원을 더 주의 깊게 볼 서열에 집중시켜 효율을 높일 수 있다는 취지의 피드백을 논문에 제공했다.
데이터베이스 무결성 문제도 겨냥한다. Protein Data Bank, UniProt, GenBank 같은 자원은 상당수 공개 제출을 받는데, 잘못 라벨링된 항목 하나가 생물보안 의사결정에 큰 영향을 줄 수 있다. AI 생성 생물학 데이터가 늘어날수록 이 위험은 커진다. 제출 과정에서 SynthID Bio를 활용하면 합성 항목을 제대로 표시하거나 추가 검토 대상으로 표시할 수 있다.
개발자 관점에서 이번 발표의 실질적인 부분은 공개 범위다. 딥마인드는 방법론 논문과 코드, 시험관 실험 데이터를 공개하고 연구 커뮤니티에 모델 가중치도 배포한다. 자체 단백질 설계 파이프라인에 워터마크 검증 단계를 붙이거나, 생성 모델 쪽에 워터마크 기능을 내장하는 작업을 직접 시도해볼 수 있다는 뜻이다. 확장 작업도 진행 중이다. 스탠퍼드대 Hie 랩, Arc Institute와의 공동 연구에서 유전체 모델 Evo 2에 SynthID Bio를 통합해 Evo 2가 설계한 박테리오파지의 게놈에 워터마크를 넣었고, 박테리아 배양 초기 실험에서 이 파지가 기능한다는 것을 확인했다. 관련 기술 원고는 곧 공개될 예정이다.
한계도 분명히 밝혀져 있다. 의도적인 변조에 맞서 워터마크를 더 견고하게 만드는 것이 앞으로의 핵심 과제다. 또 디지털 미디어의 C2PA처럼 출처 메타데이터를 다루는 방식이나 AI 생성 생물학 데이터를 모아두는 중앙 저장소와 결합해 활용할 수 있다. 단일 조치가 모든 문제를 해결하는 것은 아니라는 전제 아래, AI 생성 생물학 서열과 구조를 안정적으로 식별하고 추적하기 위한 첫 단계로 제시된 셈이다.