Skip to main content
QUICK REVIEW

[論文レビュー] Practical Privacy For Expectation Maximization.

Mijung Park, Jimmy Foulds|arXiv (Cornell University)|May 23, 2016
Privacy-Preserving Technologies in Data参考文献 11被引用数 8
ひとこと要約

本稿では、集中型微分プライバシー(CDP)下でデータの十分統計量(モーメント)をノイズ化することにより、プライバシー予算を削減しながら高い精度を達成する実用的なプライバシー保護アルゴリズムを提案する。指数型分布族モデルにおいて、この手法はデータサイズに応じて自然にノイズがスケーリングされ、混合モデルにおいて標準的なDPおよび(ε,δ)-DPを上回る性能を示す。

ABSTRACT

Expectation maximization (EM) is an iterative algorithm that computes maximum likelihood and maximum a posteriori estimates for models with unobserved variables. While widely used, the iterative nature of EM presents challenges for privacy-preserving estimation. Multiple iterations are required to obtain accurate parameter estimates, yet each iteration increases the amount of noise that must be added to achieve a reasonable degree of privacy. We propose a practical algorithm that overcomes this challenge and outputs EM parameter estimates that are both accurate and private. Our algorithm focuses on the frequent use case of models whose joint distribution over observed and unobserved variables remains in the exponential family. For these models, the EM parameters are functions of moments of the data. Our algorithm leverages this to preserve privacy by perturbing the moments, for which the amount of additive noise scales naturally with the data. In addition, our algorithm uses a relaxed notion of the differential privacy (DP) gold standard, called concentrated differential privacy (CDP). Rather than focusing on single-query loss, CDP provides high probability bounds for cumulative privacy loss, which is well suited for iterative algorithms. For mixture models, we show that our method requires a significantly smaller privacy budget for the same estimation accuracy compared to both DP and its (epsilon, delta)-DP relaxation. Our general approach of moment perturbation equipped with CDP can be readily extended to many iterative machine learning algorithms, which opens up various exciting future directions.

研究の動機と目的

  • 繰り返し実行されるEMアルゴリズムにおいて、複数回の反復によるプライバシー損失の蓄積を緩和する課題に対処すること。
  • 特に観測されない変数を含むモデルにおいて、正確なパラメータ推定に必要なプライバシー予算を低減すること。
  • 高い推定精度を維持しながら強力なプライバシー保証を提供する実用的な手法を開発すること。
  • モーメントノイズ化とCDPを活用することで、微分プライバシーの適用範囲をEMのような繰り返し処理型機械学習アルゴリズムに拡張すること。
  • 集中型微分プライバシー(CDP)が繰り返し処理型EMプロセスにおいて、標準的なDPよりもタイトなプライバシー境界を提供することを示すこと。

提案手法

  • 生データやモデルパラメータではなく、データの十分統計量(モーメント)をノイズ化することで、データ表現レベルでのプライバシー保護を実現する。
  • EMのパラメータが指数型分布族モデルにおいてモーメントの関数として表現できることを活用し、モーメントの偽装によってプライバシー保護推定を実現する。
  • 繰り返し処理に適した累積的プライバシー損失の高確率バウンドを提供する集中型微分プライバシー(CDP)を採用し、標準的なDPよりも繰り返し処理に適している。
  • ノイズをデータサイズに比例してモーメントに追加することで、プライバシーコストがイテレーション回数ではなくデータ量に自然にスケーリングされるようにする。
  • 観測変数と非観測変数の同時分布が指数型分布族に留まるモデルを想定し、解析的取り扱いが可能になるように設計する。
  • CDPを用いることで、(ε,δ)-DPの厳密な要件を緩和し、繰り返し処理環境におけるタイトなプライバシー会計と向上した有用性を実現する。

実験結果

リサーチクエスチョン

  • RQ1集中型微分プライバシー(CDP)下でのモーメントノイズ化は、繰り返し処理型アルゴリズムにおけるEM推定のためのプライバシー予算を低減できるか?
  • RQ2混合モデルにおけるEM処理において、CDPは標準的なDPおよび(ε,δ)-DPと比較してプライバシーと有用性のトレードオフにおいてどのように異なるか?
  • RQ3モデルパラメータではなく十分統計量をノイズ化することで、指数型分布族モデルにおけるEM処理でより優れた精度-プライバシーのトレードオフが達成できるか?
  • RQ4EM処理においてプライバシーコストをイテレーション回数ではなくデータサイズに自然にスケーリングできるか?これにより実用性が向上するか?
  • RQ5この手法は、EMを越える他の繰り返し処理型機械学習アルゴリズムへどの程度一般化可能か?

主な発見

  • 混合モデルにおいて、同じ推定精度を達成する場合に、標準的なDPおよび(ε,δ)-DPに比べて、提案手法が顕著に低いプライバシー予算を要する。
  • モーメントのノイズ化とCDPの併用により、標準的なDPと比較して、イテレーション全体にわたるプライバシー損失の蓄積がより有利に進行する。
  • ノイズをモーメントレベルに追加することで、データの統計的構造が保持され、高い推定精度を維持できる。
  • プライバシーコストがデータサイズに自然にスケーリングされるため、標準的なDPにおける繰り返し処理によるノイズ蓄積問題を回避できる。
  • この手法は、指数型分布族モデルにおいて十分統計量に依存する他の繰り返し処理型機械学習アルゴリズムへも一般化可能である。
  • CDPの使用により、タイトなプライバシー会計が可能となり、プライバシー感受性の高いアプリケーションにおける実用的導入が促進される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。