Skip to main content
QUICK REVIEW

[논문 리뷰] SAPAG: A Self-Adaptive Privacy Attack From Gradients

Yijue Wang, Jieren Deng|arXiv (Cornell University)|2020. 09. 14.
Privacy-Preserving Technologies in Data참고 문헌 24인용 수 8
한 줄 요약

SAPAG는 분산 학습에서 기울기로부터 학습 데이터를 복원하기 위해 적응형 가우시안 커널을 사용하여 기울기 차이를 측정하는 자기적응형 프라이버시 공격이다. 이는 다양한 DNN 아키텍처, 가중치 초기화 및 학습 단계에서 고해상도 복원을 가능하게 하며, 이전 방법인 DLG에 비해 정확도와 수렴 속도에서 뛰어난 성능을 발휘한다.

ABSTRACT

Distributed learning such as federated learning or collaborative learning enables model training on decentralized data from users and only collects local gradients, where data is processed close to its sources for data privacy. The nature of not centralizing the training data addresses the privacy issue of privacy-sensitive data. Recent studies show that a third party can reconstruct the true training data in the distributed machine learning system through the publicly-shared gradients. However, existing reconstruction attack frameworks lack generalizability on different Deep Neural Network (DNN) architectures and different weight distribution initialization, and can only succeed in the early training phase. To address these limitations, in this paper, we propose a more general privacy attack from gradient, SAPAG, which uses a Gaussian kernel based of gradient difference as a distance measure. Our experiments demonstrate that SAPAG can construct the training data on different DNNs with different weight initializations and on DNNs in any training phases.

연구 동기 및 목표

  • 다양한 DNN 아키텍처와 가중치 초기화 전략에 일반화되지 않는 기존 기울기 기반 복원 공격의 한계를 해결한다.
  • 기존 방법이 초기 학습 단계에서만 성공함에 따라 학습의 어떤 단계에서도 복원이 가능하도록 한다.
  • 대상 모델의 고유한 기울기 분포에 동적으로 적응하는 강력하고 자기적응형 프레임워크를 개발하여 복원 정밀도를 향상시킨다.
  • 컴퓨터 비전 및 자연어 처리 작업, 특히 트랜스포머 기반 모델을 포함한 다양한 작업에서 공격의 효과성을 입증한다.

제안 방법

  • 대상 모델의 기울기 분포에서 동적으로 학습되는 스케일링 인자를 가진 가우시안 커널을 사용하여 자기적응형 기울기 거리 측정 방법을 제안한다.
  • 가짜 입력을 반복적으로 업데이트하여 가짜와 실제 학습 데이터 간의 기울기 차이를 최소화하는 최적화 과정을 구현하며, 이때 적응형 가우시안 커널을 손실 지표로 사용한다.
  • 복원 과정에서 안정적이고 빠른 수렴을 위해 AdamW 최적화기를 사용하며, 모델 아키텍처에 따라 하이퍼파라미터를 조정한다.
  • 단일 이미지 및 배치 기반 학습 데이터 복원에 모두 적용하여 확장성과 효율성을 입증한다.
  • NLP 작업의 경우, 복원된 임bedding에 임베딩 가중치 행렬의 모어-펜로즈 의사역행렬을 곱하여 원본 텍스트를 복구한다.
  • 가중치 초기화나 학습 단계에 관계없이 ResNet, LeNet-5 및 트랜스포머 기반 모델을 포함한 다양한 아키텍처에서 작동하도록 공격 프레임워크를 적응시킨다.

실험 결과

연구 질문

  • RQ1기울기 기반 복원 공격은 ResNet 및 트랜스포머와 같은 다양한 DNN 아키텍처에 일반화될 수 있는가?
  • RQ2다양한 가중치 초기화 전략과 학습 단계 전반에서 공격가 성능을 유지하는가?
  • RQ3비적응형 방법인 DLG에 비해 적응형 가우시안 커널은 복원 정확도와 수렴 속도를 어떻게 향상시키는가?
  • RQ4계산 비용 증가 없이 배치 기반 학습 데이터를 효율적으로 복원할 수 있는가?
  • RQ5NLP 모델에서 토큰 단위로 텍스트를 얼마나 잘 복원할 수 있으며, 기존 방법에 비해 의미적 일관성은 어떻게 비교되는가?

주요 결과

  • SAPAG는 서로 다른 가중치 초기화 전략을 가진 ResNet-18 및 LeNet-5에서 고해상도 이미지 복원을 성공적으로 수행하였으며, 후기 학습 단계에서도 정밀한 복원을 이룩하였다.
  • 학습 및 검증 이미지 모두에 대해 높은 복원 정확도를 유지하여 기울기 정보가 전체 학습 과정 동안 유의미하게 유지됨을 시사한다.
  • 특히 깊은 네트워크인 ResNet-18에서 DLG에 비해 더 빠른 수렴 속도와 더 높은 복원 정확도를 달성하였다.
  • 배치 크기 8인 배치 기반 학습 데이터에 대해서도 SAPAG는 단일 이미지 복원과 유사한 품질로 8개의 이미지를 모두 복원하였으며, AdamW를 사용해 20,000 반복 내에 수렴하였다.
  • 트랜스포머 기반 언어 모델에서 SAPAG는 원본 텍스트의 대부분의 핵심 단어를 복구하여 의미적으로 일관되고 의미 있는 문장을 생성하였으며, 단어 복구 및 의미 일관성 측면에서 DLG를 능가하였다.
  • 깊은 네트워크인 ResNet-18에서는 L-BFGS 최적화기가 불안정했지만, AdamW는 모든 평가된 모델에서 일관되고 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.