단계별 그래디언트만으로 임바디드 에이전트의 관측-행동 궤적을 복원하는 시간적 역전 공격
Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning
무엇인가
이 논문이 다루는 문제는 분산 임바디드 강화학습의 프라이버시 가정이 얼마나 취약한가이다. 로봇 플릿이나 공유 내비게이션 같은 환경에서 에이전트는 원본 센서 데이터를 온디바이스에 남기고 정책 그래디언트만 집계 서버로 보낸다. 이 방식이 어느 정도 프라이버시를 준다고 여겨져 왔지만, 서버가 단계별 그래디언트를 순서대로 관찰하면 시간적 구조가 단일 프레임 공격을 훨씬 넘어서는 누출을 만든다. 복원된 궤적은 방 배치와 물체, 에이전트가 어디로 움직이고 어디를 응시하고 어디에 머물렀는지를 드러내며, 이는 활동 프로파일링·평면도 작성·지속 감시로 직결된다. 기존 그래디언트 역전 연구는 단일 이미지나 정적 미니배치를 i.i.d. 샘플로 취급했지만, 임바디드 정책 학습의 흔적은 물리 과정을 순서대로 측정한 것이어서 문제의 성격이 다르다.
어떻게 동작하나
제안 방법 TRACE는 궤적 수준의 amortized 역전 공격이다. 세 구성요소로 이루어진다. 그래디언트 인코더가 백만 차원급 업데이트를 저차원 잠재 벡터로 압축하고, 이미지 인코더가 문맥 임베딩을 만든다. 이 둘은 [z1, e0, z2, e1, …, zT, e(T-1)]처럼 교차 배치되어 하삼각 causal mask를 쓰는 트랜스포머에 들어가고, 트랜스포머는 게이트된 잔차 연결로 시간 문맥을 전파한다. 디코더는 두 개의 헤드를 공유하는데, 이미지 헤드는 전치 합성곱과 시그모이드로 관측을 복원하고 행동 헤드는 2층 MLP와 소프트맥스, argmax로 이산 행동을 예측한다. 즉 서버가 연속된 그래디언트 스트림을 받으면, 시간 문맥이 복원 정확도를 끌어올린다.
무엇과 다른가
학습 절차는 노출 편향을 다루는 데 초점이 있다. 초기에는 정답 프레임을 문맥으로 쓰는 teacher-forced warmup으로 병렬화와 안정성을 확보하고, 이후 scheduled sampling으로 정답을 자기 예측으로 교체한다. 교체 확률은 워밍업 구간 τ까지 0이었다가 이후 선형으로 증가한다. 여기에 짧은 horizon의 rollout 손실을 더해 자기 예측을 문맥으로 넣은 상태에서도 감독이 유지되게 하며, 피드백 프레임은 그래디언트 전파에서 분리한다. 전체 목적함수는 픽셀 MSE, L1, 행동 감독, 지각 손실, rollout 손실의 가중합이다.
어떻게 쓰나
이론적 근거도 제시된다. 먼저 방송된 체크포인트 근방에서 PPO의 clip이 항등이 되어 A2C와 PPO가 같은 그래디언트를 내고, 이것이 정책·가치·엔트로피 세 항으로 분해된다는 것을 보인다. 이어 정책 헤드 그래디언트의 열 합이 Â_t 곱하기 ||h(s_t)||_1 곱하기 (π_k − 1[k=a_t]) 형태라는 사실에서, Â가 양수면 열 합이 최소인 행동, 음수면 최대인 행동이 정답이라는 닫힌 형태 복원 규칙을 유도한다. 행동이 3개 이상이면 부호 없이 절댓값 최대만으로도 동일하며, 엔트로피 정규화가 있어도 로짓 폭과 최대 확률로 주어지는 조건이 만족되면 복원은 여전히 정확하다. 다만 완전 결정론적 정책에서는 모든 열 합이 0이 되어 정책 헤드만으로는 행동을 복원할 수 없다. 시간 문맥의 이득은 조건부 상호정보량으로 형식화되어, 과거 그래디언트 스트림을 추가로 조건화하면 잔여 엔트로피가 줄어들고 재구성 오차가 커지지 않는다는 것이 증명된다. 단 이 등식은 Markov 정책과 TD(0) 어드밴티지·리턴 추정, stop-gradient 부트스트랩 조건에서만 정확하고, λ가 0보다 큰 GAE나 롤아웃 수준 정규화는 이 조건을 위반한다.
전제와 한계
실험은 AI2-THOR 시뮬레이터의 포인트-골 내비게이션에서 수행된다. 84×84 RGB 입력, 5개 이산 행동(MoveAhead 0.25m, RotateLeft/Right 15도, LookDown/Up 15도), shared-CNN actor-critic을 PPO 또는 A2C로 학습하고 GAE 어드밴티지를 쓴다. 100개의 held-out 궤적, 궤적 길이 T=8이 기본 설정이다. 베이스라인은 DLG, Inverting Gradients, Learning to Invert다. 최적화 기반인 DLG와 IG는 PPO에서 각각 5.47dB, 8.73dB, A2C에서 6.11dB, 9.51dB에 그쳤고 행동 정확도도 실용 수준에 못 미쳤다. LtI는 16.79dB(PPO), 17.65dB(A2C)까지 올라왔지만, TRACE는 MSE를 0.023에서 0.014로(PPO), 0.018에서 0.014로(A2C) 낮추고 LPIPS를 거의 절반으로 줄였다(0.671→0.362, 0.639→0.358). 프레임당 3~4.5ms로, 수십 초가 걸리는 최적화 기반보다 수백 배 빠르다. 흥미로운 점은 T=1일 때 12.85dB로 LtI의 단일 프레임 결과보다 낮다는 것이며, 저자들은 이득이 더 강한 프레임 추출기가 아니라 시간 조건화에서 온다고 해석한다.
전이와 방어, 절제 실험도 보고된다. 목표 도메인 궤적을 전혀 쓰지 않은 zero-shot에서 PSNR 18.8dB, SSIM 0.627, 행동 복원은 완벽했고, 10%만 미세조정하면 PSNR이 2.1dB 오르고 LPIPS가 0.273으로 떨어졌으며, 50%를 쓰면 MSE 0.005, SSIM 0.74를 넘겼다. 방어에서는 그래디언트 10%만 남기는 pruning에도 PPO 재구성이 거의 그대로였고(PSNR 18.8, 행동 99.9%), 8비트 양자화는 큰 영향이 없었으나 4비트에서 PSNR이 12.4/13.3으로 떨어지고 2비트에서는 PPO 행동 정확도가 19.4%로 랜덤 수준이 됐다. 분산 0.1의 가우시안 노이즈는 PSNR 14.2/16.5, 행동 60~64%까지 떨어뜨렸고, DP-SGD가 가장 강력해 ε이 1, 5, 10일 때 SSIM 약 0.34/0.32, 행동 정확도 약 20%로 억제했다. 절제 실험에서는 궤적 길이를 1에서 8로 늘리면 약 6dB(12.85→18.74)가 오르고 LPIPS가 절반으로 줄었으며, T=64에서는 20.29dB까지 갔다. 정책·가치 말단 헤드만 쓰면 PSNR이 14.12로 급락해 고주파 구조 단서가 앞쪽 CNN과 FC 층에 있음이 확인됐고, 행동 복원은 모든 구성요소에서 99.6% 이상으로 유지됐다. 행동 손실을 빼면 행동 정확도가 19.0%로 붕괴한다.
개발자 관점에서 이 논문이 주는 신호는 명확하다. 서버가 단계별 그래디언트를 순서대로 볼 수 있는 구조라면, 그래디언트만으로 관측과 행동의 궤적이 복원될 수 있다고 가정해야 한다. 순서가 보존된 스트림은 단일 프레임 방어로 막기 어렵고, pruning이나 8비트 양자화 같은 경량 기법은 사실상 무력하다. 실제 파이프라인을 점검할 때는 그래디언트를 단계별로 전송하는지, 전송 순서가 노출되는지, secure aggregation 같은 암호적 보호를 적용하는지, 그리고 그 대신 치르는 시스템 비용이 무엇인지를 확인해야 한다. DP-SGD가 유의미한 억제를 보였지만, 저자들은 그때의 내비게이션 성능(프라이버시-유틸리티 트레이드오프)은 별도 분석이 필요하다며 평가하지 않았다.
저자들이 밝힌 전제와 한계도 분명하다. 이 공격은 단계별 그래디언트 공유를 가정하며, 여러 스텝을 묶은 클라이언트 정책 업데이트는 서로 다른 최적화 경로의 그래디언트를 합쳐 시간 구조를 줄일 수 있지만 이 논문은 다루지 않는다. secure aggregation은 개별 그래디언트 노출을 막을 수 있으나 무거운 암호 기법과 추가 시스템·보안 가정을 요구한다. 또한 공격자는 모델 아키텍처, 현재 체크포인트, 행동 공간, 학습 규칙을 아는 화이트박스이고 데이터는 모르지만, 공격 모델 학습을 위해 같은 태스크 계열의 보조 궤적이 필요하다. 이론의 시간 이득 등식은 Markov 정책과 TD(0) 조건에서만 정확하고 GAE λ>0에서는 근사적으로만 성립한다. 실험은 이산 행동과 단일 시뮬레이터(AI2-THOR) 중심이며, 연속 행동·off-policy·집계된 업데이트 설정으로의 확장은 향후 과제로 남겨져 있다.