Skip to main content
QUICK REVIEW

[논문 리뷰] MACE: A Flexible Framework for Membership Privacy Estimation in Generative Models

Yixi Xu, Sumit Mukherjee|arXiv (Cornell University)|2020. 09. 11.
Privacy-Preserving Technologies in Data참고 문헌 45인용 수 8
한 줄 요약

MACE는 훈련 데이터와 보류 데이터 샘플 간의 통계적 발산의 표본 기반 추정을 사용하여, 개인 및 인구 수준에서 생성 모델의 소속성 개인정보 위험을 정량적으로 평가하는 최초의 공식적 프레임워크를 제안한다. 이는 제한된 데이터 접근 조건 하에서도 이론적 보장을 갖는 유연하고 현실적인 위협 모델링을 가능하게 하며, 소수 집단이 평균 인구 수준보다 훨씬 높은 개인 개인정보 위험에 노출될 수 있음을 입증한다.

ABSTRACT

Generative machine learning models are being increasingly viewed as a way to share sensitive data between institutions. While there has been work on developing differentially private generative modeling approaches, these approaches generally lead to sub-par sample quality, limiting their use in real world applications. Another line of work has focused on developing generative models which lead to higher quality samples but currently lack any formal privacy guarantees. In this work, we propose the first formal framework for membership privacy estimation in generative models. We formulate the membership privacy risk as a statistical divergence between training samples and hold-out samples, and propose sample-based methods to estimate this divergence. Compared to previous works, our framework makes more realistic and flexible assumptions. First, we offer a generalizable metric as an alternative to the accuracy metric especially for imbalanced datasets. Second, we loosen the assumption of having full access to the underlying distribution from previous studies , and propose sample-based estimations with theoretical guarantees. Third, along with the population-level membership privacy risk estimation via the optimal membership advantage, we offer the individual-level estimation via the individual privacy risk. Fourth, our framework allows adversaries to access the trained model via a customized query, while prior works require specific attributes.

연구 동기 및 목표

  • 차별적 프라이버시 보장을 갖지 않은 고품질 생성 모델에 대해 공식적 프라이버시 인증서가 부족한 문제를 해결하기 위해.
  • 완전한 분포 접근이 아닌 무작위 샘플을 통한 제한된 데이터 접근 조건 하에서도 현실적인 가정에 기반한 소속성 개인정보 위험 추정을 가능하게 하기 위해.
  • 균형 잡히지 않은 또는 소수 집단의 경우를 포함해 인구 수준 최적의 소속성 이득과 개인 수준의 개인정보 위험을 모두 추정하기 위해.
  • 특정 쿼리 유형에 제한되지 않고, 훈련된 모델에 맞춤형 쿼리를 요청할 수 있도록 허용함으로써 위협 모델링의 유연성을 높이기 위해.
  • 정확도 외의 메트릭(예: AUC 기반 AM 메트릭)과 같은 개인정보 위험 메트릭에 대해 일관된 표본 기반 추정기와 이론적 보장을 제공하기 위해.

제안 방법

  • 훈련 샘플과 보류 샘플 간의 통계적 발산으로서 소속성 개인정보 위험을 정의함으로써, 경험적 샘플을 통한 추정을 가능하게 한다.
  • 베이즈 최적 분류기 기반의 최적 소속성 이득을 위한 표본 기반 추정기를 제안하며, 이론적 일관성 보장을 제공한다.
  • 각 샘플의 위험을 정량화하는 개인 개인정보 위험 추정기를 도입하여, 하위집단 수준의 분석을 가능하게 한다.
  • 특정 쿼리 구조에 제한되지 않고, 예를 들어 판별기 점수와 같은 다양한 쿼리 유형을 지원함으로써 현실적인 적대자 행동을 모델링한다.
  • 정확도 외에 더 나은 개인정보 위험 반영을 위해 AM(ROC-AUC 기반) 메트릭과 같은 일반화된 메트릭을 활용한다.
  • 제한된 데이터 접근 조건 하에서도 일관된 추정기를 도출하기 위해 통계학적 학습 이론의 기법을 응용한다. 이는 데이터 분포에서의 무작위 샘플링을 포함한다.

실험 결과

연구 질문

  • RQ1완전한 기저 데이터 분포 접근이 없이도 생성 모델에서 최대 소속성 개인정보 위험(최적의 적대자)을 추정할 수 있는가?
  • RQ2소수 집단이나 이질적 집단의 취약성을 파악하기 위해 개인 수준의 소속성 개인정보 위험을 어떻게 추정할 수 있는가?
  • RQ3정확도 기반 외의 메트릭(예: AM)을 포함해 다양한 쿼리 유형과 메트릭을 지원하는, 민감하고 표본 기반의 프레임워크를 개발할 수 있는가?
  • RQ4제한된 데이터 접근 조건 하에서 히وري스틱 적대자와 최적의 적대자 간의 성능 차이는 어떻게 되는가?
  • RQ5이 프레임워크는 고차원 쿼리 또는 모델 구성 요소(예: 생성기 및 판별기의 중간 레이어)를 지원하도록 확장할 수 있는가?

주요 결과

  • 베이즈 분류기 기반의 최적 소속성 이득 추정기는 제한된 데이터 접근 조건 하에서도 일관되고 이론적으로 타당한 개인정보 위험 상한선을 제공한다.
  • 판별기 점수를 사용하는 히وري스틱 적대자들이 정확도 및 AM 메트릭 모두에서 최적의 적대자와 유사한 성능을 보이며, 실용적 관련성을 입증한다.
  • 피부암 MNIST 데이터셋에서 손상되거나 이질적인 이미지가 손상되지 않은 이미지보다 훨씬 높은 개인 개인정보 위험을 보이며, 하위집단의 취약성을 시사한다.
  • 평균적으로 소수 집단은 전체 인구 수준의 평균보다 더 높은 개인 개인정보 위험에 노출되며, 이는 인구 수준 메트릭만으로는 가려진 위험이다.
  • 이 프레임워크는 모델 소유주나 데이터 소유주가 전체 모델, 모델 구성 요소, 또는 합성 데이터를 공개할 경우의 상대적 개인정보 위험을 평가하고, 정보 기반 공개 결정을 내리는 데 기여한다.
  • 이 프레임워크는 일반화 가능하며 생성 모델뿐 아니라 분류 모델에도 적용 가능하며, 부록에서 사례로 제시되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.