분할 학습에서 그래디언트는 토큰보다 문서 복원을 훨씬 크게 늘린다
What Gradients Add to Text Leakage in Split Language Models, Counted per Token and per Document
무엇인가
분할 학습(split learning)은 클라이언트가 모델의 앞쪽 몇 개 층을 직접 돌리고, 그 출력인 토큰별 활성값 벡터만 서버로 보내는 방식이다. 원문 텍스트는 클라이언트를 떠나지 않지만, 학습 중에는 서버가 그래디언트를 되돌려준다. 이 논문은 분할 지점을 지켜보는 수동적 관찰자가 이 두 신호만으로 클라이언트의 텍스트를 얼마나 복원할 수 있는지, 그리고 그래디언트가 활성값 위에 얼마나 더 보태는지를 통제된 비교로 측정한다. 기존 연구(BiSR 등)는 그래디언트와 활성값을 함께 쓰는 공격이 가능하다는 것을 보였지만, 활성값만으로 이미 대부분의 텍스트가 새는 상황에서 그래디언트가 추가로 기여하는 몫이 얼마인지, 그리고 그 답이 성공을 세는 단위에 따라 달라지는지는 밝히지 않았다. 저자들은 GPT-2와 Qwen3-0.6B에서 이를 실측하고, 유출을 토큰 단위와 문서 단위로 함께 보고하라고 권고한다.
어떻게 동작하나
공격자는 분할 지점의 트래픽을 바꾸지 않는 수동적 관찰자이며, 클라이언트 층의 복사본(공개 배포된 사전학습 가중치 또는 학습 후 가중치)과 소수의 공개 문서만 가진다. 두 공격자를 비교한다. 활성값만 보는 공격자와, 학습 중 서버가 되돌려주는 그래디언트(다음 토큰 손실을 활성값에 대해 미분한 값)까지 보는 결합 공격자다. 복원은 네 단계다. 첫째, 32개의 공개 보정 문서를 클라이언트 층에 통과시켜 활성값-토큰 임베딩 쌍을 얻고, 활성값에서 해당 토큰 임베딩으로 가는 릿지 회귀(ridge fit)를 적합한다. 둘째, 관측된 각 위치의 활성값에 이 회귀를 적용해 코사인 유사도로 후보 토큰 k개를 나열한다(k는 8, 16, 32). 셋째, 결합 공격자는 그 목록의 절반을 그래디언트가 제안한 토큰으로 바꾼다. 그래디언트는 다음 토큰 손실에서 오므로 한 위치의 그래디언트는 그다음 토큰에 대한 신호를 담는다. 첫 토큰은 앞 위치가 없어 그래디언트의 도움을 받지 못한다. 넷째, 폭 2의 빔 서치로 왼쪽에서 오른쪽으로 텍스트를 만들며, 후보를 붙여 활성값을 다시 계산하고 관측값과 가장 잘 맞는 두 개를 남긴다. 두 공격자는 같은 수의 부분 텍스트를 검사하므로 차이는 어떤 후보를 시도하는지뿐이다.
무엇과 다른가
주 실험은 12층 GPT-2를 3층 또는 6층 뒤에서 자르고, WikiText-2에서 뽑은 32토큰 문서를 쓴다. 공개 보정 32개, 클라이언트 학습 128개, 평가 256개로 나눈다. 사전 등록한 주 검정은 6층 분할, 공개 가중치 복사본, k=32 조건이다. 활성값만 보는 공격자가 토큰의 94.20%를 복원하고, 그래디언트까지 보면 97.38%로 3.17%포인트 오른다(95% 교차 부트스트랩 구간 [2.72, 3.64]). 활성값 공격자가 틀린 토큰의 약 55%를 그래디언트가 바로잡는다. 토큰 단위에서는 작아 보이는 이 차이가 문서 단위에서는 훨씬 커진다. 32개 토큰이 모두 맞아야 문서 하나로 세므로, 정확히 복원한 문서 비율이 13.71%에서 37.77%로 2.75배가 된다. 학습된 가중치 복사본을 쓴 6층 조건에서는 20.23%에서 58.55%로 오른다. 그래디언트 도움을 못 받는 첫 토큰이 자주 틀리는데, 주 설정의 5,120개 복원 중 활성값만 쓴 경우 2,408개, 결합 공격자 2,362개에서 첫 토큰이 틀렸고 그중 약 3분의 1은 앞 공백만 다른 경우였다. 이 첫 토큰 오류만으로 두 공격자의 문서 복원률은 약 54% 아래로 묶인다. 나머지 47개 토큰 비교도 본페로니 보정(α=0.05/47) 후 모두 구간 하한이 0 위였다. 다만 3층·학습된 복사본 조건에서는 SipIt(98.89%)이 결합 공격자(98.72%)를 근소하게 앞섰다.
어떻게 쓰나
관측된 그래디언트를 흐리게 만들어도 이득은 대부분 남는다. 6층·공개 복사본에서 σ=0.1 가우시안 노이즈를 더하면 97.31%, 8비트 양자화하면 97.33%로 참 그래디언트의 97.38%와 거의 같다. σ=1.0 노이즈에서 96.83%, 4비트 양자화에서 96.38%다. 반면 그래디언트가 입력 정보를 담지 않는 두 대조군(다른 문서의 그래디언트를 주는 셔플 대조군 93.91%, 후보 절반을 무작위로 채우는 대조군 93.89%)은 활성값만 쓰는 94.20%보다 오히려 낮았다. 학습 자체를 바꾸는 방어 두 개도 시험한다. secret mixup은 각 토큰의 활성값을 이전 학습 데이터에서 재활용한 미끼 활성값과 λ=0.75 비중으로 섞어 보내고, 돌아온 그래디언트를 (g−(1−λ)g_decoy)/λ로 보정한다. 이 방어 아래에서도 토큰의 83.01~90.67%가 복원되지만, 정확히 복원되는 문서는 최대 1.48%에 그친다. 이름 구간 복원률은 방어 없는 조건의 67.36~97.44%에서 47.85~66.15%로 떨어지지만, 숫자는 93.94~96.50%, 식별자는 90~100%가 그대로 복원된다. 대가는 모델 품질로, 헬드아웃 퍼플렉서티가 3층에서 31.8%, 6층에서 26.9% 올라간다. replica-median은 서버 층 복사본 3개를 병렬로 돌려 좌표별 중앙값을 쓰는 방어로, 퍼플렉서티가 36.05에서 36.51~36.62로 거의 오르지 않고 토큰 복원률도 0.67%포인트 안에서 움직이지만, 문서 복원률은 최대 7.7%포인트 달라진다(SipIt·공개 복사본·3층에서 43.77%에서 36.11%로 하락).
전제와 한계
두 번째 실험은 설계 질문이다. 서버가 연속된 층 구간만 학습하는 배치에서, 구간 길이 s를 고정했을 때 시작 층 b가 모델 품질과 유출을 설명하는지 묻는다. GPT-2에서 s는 2, 4, 6, b는 0, 1, 2, 3, 방어 2종, 피해자 시드 8개를 교차해 192개 모델을 학습하고, 클라이언트 단독 학습 8개를 더해 총 200개 런을 돌린다. 각 런은 배치 크기 1, 학습률 5×10⁻⁵로 AdamW 128스텝이며, 서버는 [b, b+s) 층을 학습한다. 공격자는 max(1,b)층 뒤에서 관측한다. 방어는 8비트 반올림, 그리고 4비트 반올림에 그래디언트 클리핑(1.0)과 노이즈(문서별 그래디언트 RMS의 0.1배)를 순서대로 적용하는 방식이다. 유틸리티는 클라이언트 단독 학습 모델 대비 헬드아웃 교차 엔트로피 증가분으로 정의한다. 결과적으로 길이를 알고 난 뒤에도 시작 층이 GPT-2에서는 네 조합 중 세 조합에서, Qwen3-0.6B(28층) 복제 실험에서는 네 조합 모두에서 품질과 유출의 차이를 설명했다. 다만 새 학습 런의 결과를 예측하는 데 시작 층이 도움이 된 것은 8비트 방어 조건뿐이었다.
실무적으로 가장 중요한 결론은 분할 지점을 지나는 활성값을 텍스트 자체만큼 민감한 것으로 취급하라는 것이다. 그래디언트를 전혀 쓰지 않고 추론 트래픽만 관찰해도 토큰의 94.20~97.81%가 복원됐다. 방어를 평가할 때 토큰 복원률만 보면 위험하다. secret mixup은 문서 복원률을 1.48% 이하로 떨어뜨렸지만 토큰은 83~91%가 그대로 복원됐고, 숫자와 식별자는 거의 보호되지 않았다. 따라서 토큰·문서·구간 복원률을 함께 보고해야 한다. 또한 관측된 그래디언트에 노이즈나 양자화를 걸어도(시험한 강도에서는 96.38~97.33% 유지) 그래디언트가 주는 이득이 사라지지 않았다. 층 구간을 서버에 넘길 때는 길이뿐 아니라 시작 층도 함께 선택하고 평가해야 하며, 배치 규칙은 실제 배치할 방어 아래에서 헬드아웃 시드로 검증해야 한다.
저자들이 밝힌 한계는 다음과 같다. 두 번째 실험의 유출은 릿지 기반 디코더와 공격 시드 하나로 측정했고, 공개된 최적화 기반 모델 역전 공격으로 측정하지 않았다. 실험은 GPT-2와 Qwen3-0.6B, WikiText-2의 32토큰 문서에 한정되므로 다른 모델이나 다른 종류의 텍스트는 더 많거나 더 적게 샐 수 있다. 방어를 적용한 결과는 그 방어를 아는 공격자가 같은 방법을 그대로 썼을 때의 최소한의 복원량을 보여줄 뿐이며, 방어를 겨냥해 설계된 공격은 이보다 더 복원할 수 있다. 그래디언트 섭동 실험은 학습을 바꾸지 않으므로 배치된 방어가 아니고, 저자들은 섭동이 복원률을 바꾸지 않는다는 가설을 사전에 검정하지 않았다. 첫 토큰이 그래디언트의 도움을 받지 못해 문서 복원률의 상한이 약 54%로 묶인다는 점도 결과 해석의 전제다.