Skip to main content
QUICK REVIEW

[논문 리뷰] Membership Privacy for Machine Learning Models Through Knowledge Transfer

Virat Shejwalkar, Amir Houmansadr|arXiv (Cornell University)|2019. 06. 15.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 분류 정확도를 희생시키지 않은 채 기계학습 모델의 멤버십 프라이버시를 향상시키는 지식 정련 기반 방어인 멤버십 프라이버시를 위한 정련(Distillation for Membership Privacy, DMP)을 제안한다. 보호되지 않은 교사 모델에서 예측 엔트로피가 낮은 참조 데이터를 선택함으로써 DMP는 소프트 레이블을 학생 모델로 정련하여 최신 기술 수준의 프라이버시-유용성 트레이드오프를 달성한다. 예를 들어, CIFAR100에서 65.3%의 정확도와 53.7%의 MIA 위험을 기록하며, 유사한 프라이버시 수준에서 적대적 정규화보다 정확도를 100% 향상시킨다.

ABSTRACT

Large capacity machine learning (ML) models are prone to membership inference attacks (MIAs), which aim to infer whether the target sample is a member of the target model's training dataset. The serious privacy concerns due to the membership inference have motivated multiple defenses against MIAs, e.g., differential privacy and adversarial regularization. Unfortunately, these defenses produce ML models with unacceptably low classification performances. Our work proposes a new defense, called distillation for membership privacy (DMP), against MIAs that preserves the utility of the resulting models significantly better than prior defenses. DMP leverages knowledge distillation to train ML models with membership privacy. We provide a novel criterion to tune the data used for knowledge transfer in order to amplify the membership privacy of DMP. Our extensive evaluation shows that DMP provides significantly better tradeoffs between membership privacy and classification accuracies compared to state-of-the-art MIA defenses. For instance, DMP achieves ~100% accuracy improvement over adversarial regularization for DenseNet trained on CIFAR100, for similar membership privacy (measured using MIA risk): when the MIA risk is 53.7%, adversarially regularized DenseNet is 33.6% accurate, while DMP-trained DenseNet is 65.3% accurate.

연구 동기 및 목표

  • 기존 멤버십 침투 공격(MIAs) 방어 기법의 열악한 프라이버시-유용성 트레이드오프 문제를 해결하기 위해.
  • 모델의 유용성을 유지하면서 멤버십 누출을 크게 줄이는 방어 기법을 개발하기 위해.
  • 지식 정련을 차별화된 기법으로 활용하여, 차별적 프라이버시와 결합하지 않고도 멤버십 프라이버시를 향상시키기 위해.
  • 멤버십 프라이버시를 강화하는 데 기여하는 참조 데이터의 선택 또는 생성 기준을 제공하기 위해.
  • DMP가 적응형 공격과 참조 데이터로부터의 프라이버시 누출에 대해 얼마나 견고한지 평가하기 위해.

제안 방법

  • 기밀 훈련 데이터에 대해 보호되지 않은 교사 모델을 훈련시어 기억된 패턴을 포착한다.
  • 교사 모델이 참조 데이터에 대해 예측한 결과의 엔트로피가 낮도록 참조 데이터를 선택하거나 생성하여 멤버십 정보 누출을 최소화한다.
  • 지식 정련을 통해 교사 모델의 소프트 레이블을 보호된 학생 모델로 이전한다. 학생 모델은 참조 데이터로 훈련된다.
  • 교사 모델과 학생 모델이 동일한 아키텍처를 사용하여 성능 유지를 확보하고 효과적인 정련을 가능하게 한다.
  • 교사 모델의 소프트맥스 레이어에 온도 스케일링을 적용하여 추가로 예측 신뢰도와 누출을 감소시킨다.
  • 실제 참조 데이터가 필요 없도록 GAN을 통해 참조 데이터를 합성함으로써 프라이버시와 성능을 유지한다.

실험 결과

연구 질문

  • RQ1지식 정련이 별도의 기법으로서 멤버십 프라이버시-유용성 트레이드오프를 향상시키는 데 사용될 수 있는가?
  • RQ2참조 데이터에 대한 모델 예측의 엔트로피가 멤버십 침투 위험에 어떻게 영향을 미치는가?
  • RQ3훈련 데이터에서 유도된 합성 참조 데이터가 강력한 프라이버시와 유용성을 유지할 수 있는가?
  • RQ4DMP는 적대적 정규화 및 PATE와 같은 최신 기술 방어 기법과 비교해 정확도와 MIA 저항성 측면에서 어떻게 성과를 내는가?
  • RQ5적응형 멤버십 침투 공격이 DMP의 참조 데이터 선택 메커니즘을 악용할 수 있는가?

주요 결과

  • DMP는 DenseNet에서 CIFAR100에서 65.3%의 테스트 정확도와 53.7%의 MIA 위험을 기록하며, 유사한 프라이버시 수준에서 적대적 정규화 모델(33.6%)보다 정확도가 100% 향상되었다.
  • 합성 참조 데이터를 사용할 경우 DMP는 뛰어난 성능을 유지한다: CIFAR10에서 37.5만 개의 합성 샘플을 사용해 57.5%의 테스트 정확도와 52.1%의 화이트박스 MIA 정확도를 기록했다.
  • 참조 데이터에 대한 낮은 엔트로피 예측을 사용할 경우 멤버십 침투 위험이 크게 감소하며, 37.5만 개의 합성 샘플을 사용할 경우 MIA 위험은 5.0%로 떨어졌다.
  • DMP는 정확도와 프라이버시 측면에서 PATE를 능가한다: DMP는 76.79%의 테스트 정확도와 50.8%의 화이트박스 MIA 정확도를 기록했고, PATE는 고용량 프라이버시 예산에도 불구하고 성능이 낮게 유지되었다.
  • 참조 데이터 기반의 적응형 공격는 특별한 이점이 없었으며, 근접도가 예측 엔트로피와 상관관계가 없기 때문에 이러한 전략에 대해 강건함을 보였다.
  • 참조 데이터 자체는 멤버십 정보를 누출하지 않으며, 정련에 사용된 소프트 레이블이 진짜 레이블을 은폐하기 때문에 $X_{\mathsf{ref}}$에서 성공적인 MIAs를 방지할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.