Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient Masking and the Underestimated Robustness Threats of Differential Privacy in Deep Learning

Franziska Boenisch, Philip Sperl|arXiv (Cornell University)|2021. 05. 17.
Adversarial Robustness in Machine Learning참고 문헌 28인용 수 8
한 줄 요약

이 논문은 딥러닝에서 차별적 프라이버시(DP)와 적대적 강건성 사이의 상충 관계를 조사하며, DP-SGD 학습이 적대적 공격에 대한 모델의 강건성을 감소시킨다는 것을 입증한다. DP 학습 모델이 비공개 모델보다 더 취약하며, 특정 DP 하이퍼파라미터 설정이 기울기 마스킹을 유도해 허위로 안전하다는 착각을 불러일으키는 것으로 드러났다.

ABSTRACT

An important problem in deep learning is the privacy and security of neural networks (NNs). Both aspects have long been considered separately. To date, it is still poorly understood how privacy enhancing training affects the robustness of NNs. This paper experimentally evaluates the impact of training with Differential Privacy (DP), a standard method for privacy preservation, on model vulnerability against a broad range of adversarial attacks. The results suggest that private models are less robust than their non-private counterparts, and that adversarial examples transfer better among DP models than between non-private and private ones. Furthermore, detailed analyses of DP and non-DP models suggest significant differences between their gradients. Additionally, this work is the first to observe that an unfavorable choice of parameters in DP training can lead to gradient masking, and, thereby, results in a wrong sense of security.

연구 동기 및 목표

  • 차별적 프라이버시(DP) 학습이 다양한 공격 유형에 대해 적대적 강건성에 미치는 영향을 평가하기 위해.
  • 적대적 예제가 비공개 모델과 공개 모델 간에 더 효과적으로 전이되는지 조사하기 위해.
  • 강건성 격차를 설명하기 위해 DP 모델과 비-DP 모델 간의 기울기 차이를 분석하기 위해.
  • DP-SGD가 기울기 마스킹을 유도하는 조건을 규명하고 검증하기 위해, 이로 인해 강건성 평가가 잘못 평가되는 경우를 밝혀내기 위해.
  • DP 학습이 프라이버시 보장을 제공함에도 불구하고 모델 보안을 약화시킬 수 있음을 경험적으로 입증하기 위해.

제안 방법

  • 저자들은 다양한 노이즈 수준과 기울기 클리핑 노름을 사용하여 DP-SGD를 적용한 여러 딥 네트워크 모델을 학습시켰다.
  • 기울기 기반, 기울기 무관, 최적화 기반 방법을 포함한 포괄적인 적대적 공격 세트를 사용하여 강건성을 평가했다.
  • 비공개 모델과 공개 모델 간의 적대적 예제 전이성을 측정하여 교차 모델 공격 성공률를 평가했다.
  • DP 모델과 비-DP 모델의 기울기를 분석하고 비교하여 강건성에 영향을 주는 구조적 차이를 규명했다.
  • 기울기 마스킹 존재 여부를 확인하기 위해 기울기 마스킹에 대한 기존 기준을 적용했다.
  • 노이즈 스케일과 클립 노름이 모델 취약성과 기울기 행동에 미치는 영향을 분리하기 위해 아블레이션 연구를 수행했다.

실험 결과

연구 질문

  • RQ1DP-SGD로 학습한 모델이 비공개 모델에 비해 딥 네트워크의 적대적 강건성을 감소시키는가?
  • RQ2비공개 모델과 공개 모델 간의 적대적 전이성은 어떻게 다른가?
  • RQ3모델 기울기는 DP 모델의 증가한 취약성에 기여하는 역할을 하는가?
  • RQ4어떤 DP-SGD 하이퍼파라미터 설정에서 기울기 마스킹이 발생하며, 어떻게 강건성 평가를 오도하는가?
  • RQ5DP 모델에서의 기울기 마스킹은 이전 연구에서 보고된, 비록 긍정적으로 보였지만 실제로는 잘못된 강건성 결과를 설명할 수 있는가?

주요 결과

  • 특히 높은 노이즈 수준과 큰 클립 노름에서 DP 모델은 비공개 모델에 비해 적대적 공격에 훨씬 더 낮은 강건성을 보인다.
  • 비공개 모델에서 공개 모델로의 적대적 예제 전이가 반대 방향보다 더 효과적임을 확인하여, 공개 모델이 전이 공격에 더 취약함을 시사한다.
  • DP 모델 간의 전이성이 비공개 모델과 공개 모델 간의 전이성보다 더 높으며, 이는 DP 모델 간에 더 많은 전이 가능한 적대적 특징을 공유하고 있음을 나타낸다.
  • DP 학습은 비-DP 모델에 비해 더 큰 기울기 크기와 더 높은 비율의 0 기울기를 유도하며, 이는 취약성 증가를 설명할 수 있다.
  • 특정 노이즈 스케일과 클립 노름 조합이 의도적으로 DP-SGD에서 기울기 마스킹을 유도하여, 강건성에 대한 잘못된 인식을 유도한다.
  • 연구는 특정 하이퍼파라미터 설정 하에서 DP 모델에 기울기 마스킹이 존재함을 확인하였으며, 이는 강건성 평가에서 혼동 요인으로 작용함을 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.