Skip to main content
QUICK REVIEW

[논문 리뷰] DP-EM: Differentially Private Expectation Maximization

Mijung Park, Jimmy Foulds|UvA-DARE (University of Amsterdam)|2016. 05. 23.
Privacy-Preserving Technologies in Data인용 수 9
한 줄 요약

이 논문은 순간 펌핑(moment perturbation)과 정교한 조합 기법—모멘츠 회계(MA) 및 제로평균 집중적 차별적 프라이버시(zCDP)—를 사용하는 차별적 프라이버시 보장 기반 기반의 기대최대화(EM) 알고리즘인 DP-EM을 제안한다. 이는 반복적 단계 간의 노이즈 누적을 줄이는 데 기여하며, 표준 DP 방법보다 뛰어난 유틸리티를 달성한다. 실험 결과는 엄격한 프라이버시 예산 하에서 가우시안 혼합 모델과 요인 분석에서 성능 향상을 입증한다.

ABSTRACT

The iterative nature of the expectation maximization (EM) algorithm presents a challenge for privacy-preserving estimation, as each iteration increases the amount of noise needed. We propose a practical private EM algorithm that overcomes this challenge using two innovations: (1) a novel moment perturbation formulation for differentially private EM (DP-EM), and (2) the use of two recently developed composition methods to bound the privacy "cost" of multiple EM iterations: the moments accountant (MA) and zero-mean concentrated differential privacy (zCDP). Both MA and zCDP bound the moment generating function of the privacy loss random variable and achieve a refined tail bound, which effectively decrease the amount of additive noise. We present empirical results showing the benefits of our approach, as well as similar performance between these two composition methods in the DP-EM setting for Gaussian mixture models. Our approach can be readily extended to many iterative learning algorithms, opening up various exciting future directions.

연구 동기 및 목표

  • EM과 같은 반복적 알고리즘에서 각 반복 단계가 프라이버시 비용을 증가시키는 노이즈 누적 문제를 해결하기 위해.
  • 지수족의 완전한 데이터 우도를 갖는 모델에 적용 가능한 실용적인 프라이빗 EM 프레임워크를 개발하기 위해.
  • 모멘츠 회계(MA)와 zCDP와 같은 고급 조합 방법을 통해 프라이버시 손실 한계를 강화하고 추가 노이즈를 줄여 유틸리티를 향상시키기 위해.
  • 실제 데이터셋에서 가우시안 혼합 모델과 요인 분석에 대해 프레임워크를 실증적으로 검증하여 고정된 프라이버시 예산 하에서 유틸리티 향상을 입증하기 위해.
  • 기타 반복적 기계학습 알고리즘을 사전 처리하기 위한 일반화 가능한 접근법을 제공하기 위해.

제안 방법

  • 데이터 서브샘플링이 필요 없도록, 충분통계량(잠재변수 및 관측변수의 순간)을 프라이버시를 위해 펌핑하는 순간 펌핑 공식을 제안한다.
  • 모멘츠 회계(MA)와 제로평균 집중적 차별적 프라이버시(zCDP)를 사용하여 다중 EM 반복 단계 간의 프라이버시 손실을 제한한다.
  • 프라이버시 손실 랜덤 변수의 모멘트 생성 함수를 모델링하기 위해 레니의 분산을 사용하여 더 강력한 尾 꼬리 한계를 확보하고 노이즈를 감소시킨다.
  • 가우시안 혼합 모델(MoG)과 요인 분석(FA)에 대한 DP-EM 알고리즘을 유도하며, 가우시안 메커니즘을 통해 중심점과 로딩 행렬에 노이즈를 추가한다.
  • zCDP와 MA 조합을 사용하여 표준 조합 정리보다 더 효율적인 누적 프라이버시 예산을 계산한다.
  • 실제 데이터셋에서 유틸리티 평가를 위해 정규화된 내부 클러스터 분산(NICV)과 학습된 구성요소의 시각적 점검을 활용한다.

실험 결과

연구 질문

  • RQ1EM에서의 순간 펌핑은 데이터 서브샘플링 없이도 프라이버시를 유지하는 데 사용될 수 있는가?
  • RQ2정교한 조합 기법(MA 및 zCDP)을 사용할 경우, 표준 조합 기법에 비해 반복적 프라이빗 EM에서 노이즈를 상당히 줄일 수 있는가?
  • RQ3고정된 프라이버시 예산 하에서, Gowalla와 Olivetti Faces와 같은 실제 세계 데이터셋에서 DP-EM의 유틸리티는 어떻게 평가되는가?
  • RQ4특히 노이즈 감소와 계산 효율성 측면에서, zCDP는 MA보다 프라이빗 EM 환경에서 더 효과적인가?
  • RQ5제안된 DP-EM 프레임워크는 MoG와 FA를 초월한 다른 반복 학습 알고리즘으로 확장 가능한가?

주요 결과

  • ε = 0.01의 작은 프라이버시 예산에서도, zCDP 조합을 사용한 DP-EM은 표준 조합을 사용한 DPLloyd보다 낮은 정규화된 내부 클러스터 분산(NICV)을 달성했다.
  • 일부 영역에서 zCDP 조합 방법은 MA를 초월했으며, 계산이 더 쉬워 프라이빗 EM에 더 바람직한 것으로 나타났다.
  • ε = 0.3 및 δ = 10−4 조건에서, 프라이빗 요인 분석은 비프라이빗 버전과 거의 동일한 얼굴 구성요소를 복원하여 높은 유틸리티를 입증했다.
  • zCDP 및 MA 모두에서 GGG 조합(Gaussian 메커니즘 + zCDP)은 LLG(Laplace 메커니즘 + 표준 조합)보다 노이즈 감소 측면에서 뛰어났다.
  • 순간 펌핑 접근법은 데이터 서브샘플링 없이도 반복 단계당 효과적인 프라이버시 예산 사용을 가능하게 하여 실용성을 향상시켰다.
  • 실증 결과는 MA와 zCDP가 MoG에 대한 DP-EM에서 유사한 성능을 보였지만, 실제로는 zCDP가 더 높은 유틸리티와 효율성을 제공함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.