Skip to main content
QUICK REVIEW

[논문 리뷰] Membership Inference Attacks and Defenses in Neural Network Pruning

Xiaoyong Yuan, Lan Zhang|arXiv (Cornell University)|2022. 02. 07.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 도색된 신경망에서 멤버십 유추 공격(MIA)에 대한 최초의 종합적 분석을 제시하며, 도색으로 인해 멤버와 비멤버 간 예측의 분리도가 증가함에 따라 프라이버시 누출이 증가함을 입증한다. 이는 기존 공격보다 우수한 성능을 보이는 자기주의 기반 MIA를 제안하고, KL-발산 기반 방어 기법을 도입하여 프라이버시 위험을 줄이지만 모델의 흩어진 정도와 정확도는 유지한다.

ABSTRACT

Neural network pruning has been an essential technique to reduce the computation and memory requirements for using deep neural networks for resource-constrained devices. Most existing research focuses primarily on balancing the sparsity and accuracy of a pruned neural network by strategically removing insignificant parameters and retraining the pruned model. Such efforts on reusing training samples pose serious privacy risks due to increased memorization, which, however, has not been investigated yet. In this paper, we conduct the first analysis of privacy risks in neural network pruning. Specifically, we investigate the impacts of neural network pruning on training data privacy, i.e., membership inference attacks. We first explore the impact of neural network pruning on prediction divergence, where the pruning process disproportionately affects the pruned model's behavior for members and non-members. Meanwhile, the influence of divergence even varies among different classes in a fine-grained manner. Enlighten by such divergence, we proposed a self-attention membership inference attack against the pruned neural networks. Extensive experiments are conducted to rigorously evaluate the privacy impacts of different pruning approaches, sparsity levels, and adversary knowledge. The proposed attack shows the higher attack performance on the pruned models when compared with eight existing membership inference attacks. In addition, we propose a new defense mechanism to protect the pruning process by mitigating the prediction divergence based on KL-divergence distance, whose effectiveness has been experimentally demonstrated to effectively mitigate the privacy risks while maintaining the sparsity and accuracy of the pruned models.

연구 동기 및 목표

  • 신경망 도색이 훈련 데이터 프라이버시에 미치는 영향, 특히 멤버십 유추 공격 측면에서의 영향을 조사하는 것.
  • 도색이 서로 다른 클래스 간 멤버와 비멤버 간 예측 분리도에 미치는 영향을 분석하는 것.
  • 도색된 모델에 특화된 새로운 효과적인 멤버십 유추 공격을 개발하는 것.
  • 모델의 흩어진 정도나 정확도를 희생시키지 않고 프라이버시 누출을 완화하는 방어 기법을 제안하는 것.

제안 방법

  • 저자는 도색된 모델에서 예측 분리도를 분석하여 멤버와 비멤버 간에 비례하지 않는 행동 변화가 발생함을 보여준다.
  • 그들은 로그리트 간의 상호관계를 모델링함으로써 멤버십 유추 성능을 향상시키기 위해 자기주의 기반 메커니즘을 설계한다.
  • 방어 방법은 멤버와 비멤버의 예측 분포 간 KL-발산 최소화를 통해 구별 가능성을 줄이는 데 초점을 맞춘다.
  • 방어 기법은 도색 후 재학습 단계에 통합되어 모델 성능을 유지한다.
  • 실험은 다양한 도색 전략, 흩어진 정도 수준, 공격자 지식 설정에서 공격 및 방어 성능을 비교한다.
  • 공격 및 방어 기법은 통제된 아블레이션을 통해 프라이버시 영향을 분리하여 표준 비전 벤치마크에서 평가된다.

실험 결과

연구 질문

  • RQ1신경망 도색은 모델의 멤버십 유추 공격에 대한 취약도에 어떤 영향을 미치는가?
  • RQ2도색은 멤버십 유추 공격이 악용할 수 있는 클래스별로 예측 분리도의 차이를 유도하는가?
  • RQ3자기주의 기반 메커니즘이 기존 공격 대비 도색된 모델에서 멤버십 유추 성능을 향상시킬 수 있는가?
  • RQ4KL-발산 기반 완화 방법은 정확도나 흩어진 정도를 떨어뜨리지 않으면서 도색된 모델에서 프라이버시 누출을 어느 정도 줄일 수 있는가?
  • RQ5다양한 도색 전략과 공격자 지식 수준에서 제안된 공격 및 방어 기법의 성능는 어떻게 변하는가?

주요 결과

  • 제안된 자기주의 기반 멤버십 유추 공격은 도색된 모델에서 기존 8종의 MIA 방법보다 높은 공격 성공률을 기록한다.
  • 도색은 특히 클래스에 따라 다른 방식으로 멤버와 비멤버 간 예측 분리도를 증가시켜 프라이버시 위험을 악화시킨다.
  • KL-발산 기반 방어 기법은 멤버십 유추 공격의 성공률을 크게 감소시키지만 모델의 흩어진 정도와 정확도는 유지한다.
  • 이 방어 기법은 다양한 도색 방법과 흩어진 정도 수준에서 효과적이며, 다양한 도색 제도에 대한 강건성을 보여준다.
  • 공격 성능은 도색된 모델에서 비도색 모델보다 높게 나타나 도색이 프라이버시 누출을 악화시킨다는 것을 시사한다.
  • 실험 결과, 고도의 흩어진 정도 수준에서도 기준 모델과 정확도 차이가 1% 이내로 유지됨을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.