Skip to main content
QUICK REVIEW

[논문 리뷰] Locally Private Bayesian Inference for Count Models

Aaron Schein, Zhiwei Steven Wu|arXiv (Cornell University)|2018. 03. 22.
Privacy-Preserving Technologies in Data참고 문헌 47인용 수 4
한 줄 요약

이 논문은 희박한 카운트 데이터 모델, 특히 포아송 인자분석 모델에서 국소적 비밀유지 조건 하에 새로운 MCMC 알고리즘을 제안한다. 기하 기계를 스켈람 분포를 통해 재해석하고 스켈람과 베셀 분포 사이의 관계를 연결하는 정리를 활용한다. 이는 나약한 접근 방식보다 뛰어난 성능을 보이며, 실제 엔론 이메일 데이터를 이용한 토픽 모델링과 링크 예측에서 비공개 추론보다도 성능이 뛰어나며, 노이즈에 대해 강건하고 잠재적 구조 복원의 일관성 향상을 보여준다.

ABSTRACT

We present a general method for privacy-preserving Bayesian inference in Poisson factorization, a broad class of models that includes some of the most widely used models in the social sciences. Our method satisfies limited precision local privacy, a generalization of local differential privacy, which we introduce to formulate privacy guarantees appropriate for sparse count data. We develop an MCMC algorithm that approximates the locally private posterior over model parameters given data that has been locally privatized by the geometric mechanism (Ghosh et al., 2012). Our solution is based on two insights: 1) a novel reinterpretation of the geometric mechanism in terms of the Skellam distribution (Skellam, 1946) and 2) a general theorem that relates the Skellam to the Bessel distribution (Yuan & Kalbfleisch, 2000). We demonstrate our method in two case studies on real-world email data in which we show that our method consistently outperforms the commonly-used naive approach, obtaining higher quality topics in text and more accurate link prediction in networks. On some tasks, our privacy-preserving method even outperforms non-private inference which conditions on the true data.

연구 동기 및 목표

  • 국소적 비밀유지 조건 하에서 카운트 데이터 모델, 특히 포아송 인자분석에 대해 개인정보 보호 기반 베이지안 추론 방법을 개발한다.
  • 국소적 비밀유지에 의해 노이즈가 첨부된 데이터만 이용 가능한 상황에서 모델을 피팅하는 통계적 과제를 해결한다.
  • 노이즈가 첨부된 데이터를 그대로 사용하는 나약한 접근 방식은 과적합과 잠재적 구조 복원 실패를 초래하므로 이를 개선한다.
  • 희박한 카운트 데이터에 특화된 국소적 비밀유지의 제한된 정밀도(LPLP)를 도입하며, 표준 국소적 비밀유지의 일반화이다.
  • 비밀유지 메커니즘이 정규화 역할을 할 수 있음을 보여주며, 실제 데이터에서 모델의 강건성과 성능 향상을 이룬다.

제안 방법

  • 희박한 카운트 데이터에 특화된 국소적 비밀유지의 제한된 정밀도(LPLP)를 도입하며, 포아송 인자분석 모델에서의 국소적 비밀유지 조건을 일반화한다.
  • 카운트 데이터를 비밀유지하기 위해 기하 기계(Ghosh 등, 2012)를 적용하며, LPLP를 만족함을 증명한다.
  • 기하 기계를 스켈람 분포를 통해 재해석함으로써 노이즈 과정의 해석적 역전환을 가능하게 한다.
  • 스켈람 분포와 베셀 분포 사이의 일반 정리를 수립함으로써, 후행 분포 추정을 효율적으로 수행할 수 있도록 한다.
  • 국소적 비밀유지 하에서 후행 분포 근사화를 가능하게 하는 새로운 MCMC 알고리즘을 개발한다. 이 알고리즘은 모델 파라미터를 기반으로 참값을 역분포로부터 반복적으로 재표본 추출하고, 그 반대로도 반복하여 후행 분포를 추정한다.
  • 알고리즘을 모듈러하게 설계하여, 표본화된 참값을 조건으로 삼아 기존의 비공개 MCMC 샘플러를 잠재 변수에 재사용할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1국소적으로 비밀유지된 데이터를 가진 포아송 인자분석 모델에서, 잠재적 구조를 정확히 복원할 수 있는 베이지안 추론 방법을 개발할 수 있는가?
  • RQ2기하 기계가 스켈람 분포를 통해 재해석될 경우, 비밀유지 과정의 효율적이고 정확한 역전환을 가능하게 하는가?
  • RQ3제안된 방법은 나약한 접근 방식(노이즈가 첨부된 데이터를 노이즈 없이 취급하는 방식)보다 모델의 일관성과 예측 정확도 측면에서 뛰어나게 성능을 높일 수 있는가?
  • RQ4적절히 모델링된 국소적 비밀유지가 정규화의 한 형태로 작용하여 비공개 추론보다 성능을 향상시키는가?
  • RQ5다양한 비밀유지 예산 하에서, 이메일 통신 네트워크와 같은 실제 희박한 카운트 데이터에서 이 방법은 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 방법은 합성 데이터 및 실제 엔론 이메일 데이터 모두에서 참값 복원에 있어 나약한 접근 방식보다 일관되게 뛰어난 성능을 보이며, 평균 절대 오차(MAE)가 낮아졌다.
  • 엔론 코퍼스에서, 제안된 방법은 나약한 접근 방식과 비공개 방법(참값을 관찰하는 방법)보다도 낮은 재구성 MAE를 달성했다.
  • 결측 링크 예측에서, 대부분의 설정에서 제안된 방법이 가장 낮은 헬드아웃 MAE를 기록했으며, 나약한 접근 및 비공개 기반 기준보다 뛰어났다.
  • 토픽 모델링에서, 제안된 방법이 추론한 토픽은 나약한 접근 방식보다 더 높은 의미적 품질을 보였다.
  • 합성 데이터에서, 제안된 방법은 높은 노이즈 수준에서도 참값의 블록 구조를 성공적으로 복원했으며, 나약한 접근 방식은 노이즈에 과적합되어 희박한 패턴을 복원하지 못했다.
  • 놀랍게도, 개인정보 보호 방법이 때로 비공개 추론보다도 뛰어난 성능을 보였으며, 이는 노이즈 메커니즘이 과적합을 방지하는 정규화 역할을 함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.