Skip to main content
QUICK REVIEW

[論文レビュー] Private Topic Modeling

Mijung Park, James R. Foulds|arXiv (Cornell University)|Sep 14, 2016
Privacy-Preserving Technologies in Data参考文献 13被引用数 7
ひとこと要約

本稿では、プライバシー会計のモーメント会計士とサブサンプリングに基づくプライバシー拡散を組み合わせることで、潜在ディリクレ配分(LDA)のためのプライバシー保護付き確率的変分ベイズ推論手法を提案する。この手法により、ノイズを著しく低減しつつトピックの一貫性を維持でき、Wikipediaデータ上での性能がSOTAを達成し、ε ≈ 2.44を達成した。

ABSTRACT

We develop a privatised stochastic variational inference method for Latent Dirichlet Allocation (LDA). The iterative nature of stochastic variational inference presents challenges: multiple iterations are required to obtain accurate posterior distributions, yet each iteration increases the amount of noise that must be added to achieve a reasonable degree of privacy. We propose a practical algorithm that overcomes this challenge by combining: (1) an improved composition method for differential privacy, called the moments accountant, which provides a tight bound on the privacy cost of multiple variational inference iterations and thus significantly decreases the amount of additive noise; and (2) privacy amplification resulting from subsampling of large-scale data. Focusing on conjugate exponential family models, in our private variational inference, all the posterior distributions will be privatised by simply perturbing expected sufficient statistics. Using Wikipedia data, we illustrate the effectiveness of our algorithm for large-scale data.

研究の動機と目的

  • 反復的変分ベイズ推論におけるプライバシーの適用に際し、反復回数に伴いノイズが蓄積されるという課題に対処すること。
  • よりタイトなプライバシー会計を活用することで、確率的変分ベイズ推論におけるプライバシー要件に必要なノイズを低減すること。
  • 大規模データのサブサンプリングを活用し、プライバシー拡散を実現し、さらにノイズを低減すること。
  • モデルの有用性を維持しつつ、実用的でスケーラブルなプライベートトピックモデリング手法を開発すること。

提案手法

  • 複数回の変分ベイズ推論反復における累積的プライバシーコストのタイトな境界を計算するために、モーメント会計士手法を用いる。
  • 大規模データセットに対するサブサンプリングを適用し、プライバシー拡散を達成することで、各更新における必要ノイズを低減する。
  • Eステップにおける期待十分統計の摺り込みと、Mステップにおける期待自然パラメータの摺り込みにより、変分ベイズプロセスをプライベート化する。
  • すべての事後分布が十分統計へのノイズ注入によってプライベート化される共役指数型分布族の枠組み内で動作する。
  • 2段階の変分ベイズ推論手順を採用する:Eステップでは摺り混ぜられた期待十分統計を用いて潜在変数の事後分布を計算し、Mステップではプライベート化された期待値を用いてモデルパラメータを更新する。
  • 複数反復における総プライバシー損失を制限するために、モーメント会計士の合成定理を用いることで、標準的な合成手法よりもノイズを低減可能となる。

実験結果

リサーチクエスチョン

  • RQ1反復的確率的変分ベイズ推論におけるトピックモデリングに差分プライバシーを効果的に適用できるか。その際、ノイズの過剰な増加が生じないか。
  • RQ2変分ベイズ推論の文脈において、標準的な合成定理と比較して、モーメント会計士がどのようにプライバシー会計を改善するか。
  • RQ3大規模トピックモデリングにおいて、サブサンプリングがどれほどプライバシーを拡散させ、与えられたプライバシー予算に対して必要なノイズをどれほど低減できるか。
  • RQ4プライベートトピックモデルの有用性は、非プライベートモデルと比較して、トピックの一貫性とパープレキシティの観点からどの程度高いか。

主な発見

  • モーメント会計士の合成手法により、強力合成と比較してノイズが著しく低減され、同じプライバシー予算下でパープレキシティが低くなった。
  • ミニバッチサイズが20,000でσ = 1.24の場合、Wikipediaデータ上でのパーソナライズド・パープレキシティは依然として妥当な低さを維持し、ε ≈ 2.44を達成した。
  • 非プライベートLDAは最も一貫性の高いトピックを生成したが、モーメント会計士を用いたプライベートLDAは、ノイズが加わっても意味のあるトピック構造を保持していた。
  • 強力合成では、モーメント会計士と比較して著しく多くのノイズが必要であり、その結果、トピックの一貫性が低下し、上位語の確率質量も減少した。
  • 大きなミニバッチサイズは信号対ノイズ比を向上させ、パープレキシティを低下させたが、サブサンプリング率の上昇に伴いプライバシーコストも上昇した。
  • プライバシー(ε ≈ 2.44)とモデル有用性の間で良好なトレードオフを達成し、トピックは解釈可能であり、上位語の確率は高いままであった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。