Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Leakage from Gradients

Ligeng Zhu, Zhijian Liu|arXiv (Cornell University)|2019. 06. 21.
Adversarial Robustness in Machine Learning참고 문헌 36인용 수 20
한 줄 요약

이 논문은 분산 기계 학습에서 공유된 기울기에서 비밀 훈련 데이터—이미지와 텍스트 모두—를 정확하게 복원하는 최적화 기반 공격인 Deep Leakage from Gradients(DLG)를 소개한다. 이 방법은 실질적인 기울기와 일치하도록 더미 입력과 레이블을 반복적으로 최적화하여, 몇 번의 단계 내에 픽셀 수준 및 토큰 수준의 정확한 복원을 달성하며, 기울기 공유 시스템의 심각한 개인정보 유출 위험을 드러낸다.

ABSTRACT

Exchanging gradients is a widely used method in modern multi-node machine learning system (e.g., distributed training, collaborative learning). For a long time, people believed that gradients are safe to share: i.e., the training data will not be leaked by gradient exchange. However, we show that it is possible to obtain the private training data from the publicly shared gradients. We name this leakage as Deep Leakage from Gradient and empirically validate the effectiveness on both computer vision and natural language processing tasks. Experimental results show that our attack is much stronger than previous approaches: the recovery is pixel-wise accurate for images and token-wise matching for texts. We want to raise people's awareness to rethink the gradient's safety. Finally, we discuss several possible strategies to prevent such deep leakage. The most effective defense method is gradient pruning.

연구 동기 및 목표

  • 분산 기계 학습 시스템에서 공유된 기울기가 비밀 훈련 데이터를 누출시킬 수 있는지 조사하기.
  • 생성 모델이나 사전 데이터 지식에 의존하지 않고 기울기에서 정확한 훈련 샘플(입력 및 레이블)을 복원하는 방법을 개발하기.
  • 비전 및 언어 작업 전반에 걸쳐 기울기 기반 데이터 복원의 실현 가능성과 효과성을 평가하기.
  • 모델의 유효성 유지와 함께 이러한 공격을 방지할 수 있는 방어 전략을 식별하고 분석하기.

제안 방법

  • 공격은 입력 데이터와 레이블을 학습 가능한 변수로 간주하는 최적화 프레임워크를 사용하며, 초기화는 무작위로 수행된다.
  • 더미 데이터에 대해 순방향 및 역방향 전파를 수행하여 기울기를 계산하고, 이 기울기와 모델의 실제 기울기 사이의 L2 거리 최소화를 통해 최적화를 수행한다.
  • 더미 입력과 레이블을 번갈아가며 업데이트하여 실제 기울기와 일치시키며, 최종적으로 원래의 훈련 샘플로 수렴한다.
  • 재구성된 입력과 레이블가 원래 데이터와 구분되지 않을 정도가 될 때까지 반복적으로 적용된다.
  • 이 방법은 생성 모델, 클래스 레이블, 또는 사전 데이터 분포 가정이 필요하지 않다.
  • 방어 전략은 기울기 노이즈(가우시안/라플라스 노이즈), 저해상도 표현(fP16, bfloat16, int8), 기울기 희소화(자르기)를 통해 평가된다.

실험 결과

연구 질문

  • RQ1분산 기계 학습 시스템에서 공개적으로 공유된 기울기에서 비밀 훈련 데이터를 복원할 수 있는가?
  • RQ2기울기 정보만을 사용하여 합성 근사치가 아닌 정확한 입력 샘플(정확한 복원)을 복원할 수 있는가?
  • RQ3기울기 노이즈, 정량화, 희소화와 같은 일반적인 방어 조치가 이 공격을 완화하는 데 얼마나 효과적인가?
  • RQ4기울기 기반 데이터 유출 상황에서 모델 정확도와 방어 효과성 간의 상호 교환 관계는 어떠한가?

주요 결과

  • DLG는 이미지 분류 작업에서는 픽셀 수준 정확도로, 마스킹 언어 모델링 작업에서는 토큰 수준 정확한 일치로 훈련 데이터를 성공적으로 복원한다.
  • 공격은 단 몇 백 개의 최적화 단계 내에 전체 데이터 복원을 달성하여 높은 효율성과 효과성을 입증한다.
  • 노이즈 스케일이 10^-2 이상인 기울기 흐림(가우시안 또는 라플라스)은 공격을 효과적으로 방지하지만, 이보다 낮은 스케일은 실패한다.
  • 반정밀도 형식(fP16, bfloat16)은 DLG에 대해 방어하지 못하며, 정밀도가 낮아졌음에도 불구하고 공격이 여전히 효과적이다.
  • 기울기 희소화 비율 20% 이상일 경우 유출 방지가 성공하며, 더 높은 희소화 비율(예: 99%)은 매우 효과적이지만 모델 정확도를 떨어뜨린다.
  • 정수 정량화(int8)는 공격을 방어하지만, CIFAR-100에서 정확도가 크게 감소(53.7%로 하락)하여 강력한 상호 교환 관계를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.