Skip to main content
QUICK REVIEW

[論文レビュー] An end-to-end Differentially Private Latent Dirichlet Allocation Using a Spectral Algorithm

Christopher DeCarolis, Mukul Ram|arXiv (Cornell University)|May 25, 2018
Privacy-Preserving Technologies in Data参考文献 27被引用数 5
ひとこと要約

本稿では、行列およびテンソル分解を用いて、最初のエンド・ツー・エンドの微分プライバシーを満たすスペクトル的手法による潜在ディリクレ割り当て(LDA)のためのアルゴリズムを提示する。アルゴリズム的エッジのプライバシー保護型設定を同定し、感度とユーティリティのトレードオフを厳密に分析することで、微分プライバシーのもとで一貫したモデルパラメータの回復が達成され、あらゆるプライバシー制度において、プライベートな変分推論を上回るユーティリティを達成する。

ABSTRACT

We provide an end-to-end differentially private spectral algorithm for learning LDA, based on matrix/tensor decompositions, and establish theoretical guarantees on utility/consistency of the estimated model parameters. The spectral algorithm consists of multiple algorithmic steps, named as "{edges}", to which noise could be injected to obtain differential privacy. We identify \emph{subsets of edges}, named as "{configurations}", such that adding noise to all edges in such a subset guarantees differential privacy of the end-to-end spectral algorithm. We characterize the sensitivity of the edges with respect to the input and thus estimate the amount of noise to be added to each edge for any required privacy level. We then characterize the utility loss for each configuration as a function of injected noise. Overall, by combining the sensitivity and utility characterization, we obtain an end-to-end differentially private spectral algorithm for LDA and identify the corresponding configuration that outperforms others in any specific regime. We are the first to achieve utility guarantees under the required level of differential privacy for learning in LDA. Overall our method systematically outperforms differentially private variational inference.

研究の動機と目的

  • 微分プライバシーと一貫したモデルパラメータ回復の両方を保証するLDAのための微分プライバシー学習アルゴリズムの開発。
  • ノイズ注入がエンド・ツー・エンドの微分プライバシーを保つようなアルゴリズム的エッジの設定を同定すること。
  • 各エッジの入力変化に対する感度を解析的に特定し、プライバシー予算のキャリブレーションに活用すること。
  • 各設定におけるユーティリティ損失を定量化し、与えられたプライバシー予算に対して最適な設定を同定すること。
  • 特にプライベートな変分推論と比較して、プライバシー制約下でのモデル品質を向上させること。

提案手法

  • 方法のモーメント法に基づくスペクトル的手法を用い、行列/テンソル分解によりLDAパラメータを学習する。
  • 原始的モーメントから最終的なトピック・ワード分布に至るまでの中間計算ステップを表す10のエッジ(e₀からe₉)からなるアルゴリズム的フローチャートを採用する。
  • ノイズを特定されたエッジのサブセット(「設定」として呼ばれる)に注入することで、合成則および事後処理の定理を活用し、微分プライバシーを確保する。
  • モーメントおよび行列/テンソルノルムの性質を用いて、各エッジの感度を解析的に上限付けし、ガウスノイズ機構を用いた正確なノイズキャリブレーションを可能にする。
  • ユーティリティ損失を注入ノイズの関数としてモデル化し、プライバシー制約下で尤度を最大化する最適な設定を選択する。
  • 十分統計量にガウスノイズを注入することで、エンド・ツー・エンドのプライバシーを保証する微分プライバシー尤度計算を実現する。

実験結果

リサーチクエスチョン

  • RQ1どのアルゴリズム的エッジのサブセット(設定)に対してノイズを注入すれば、エンド・ツー・エンドの微分プライバシーが保証されるか?
  • RQ2スペクトル的LDAパイプライン内の各エッジの感度を、プライバシー予算キャリブレーションのために解析的に上限づけるにはどうすればよいか?
  • RQ3各設定におけるプライバシーとユーティリティのトレードオフは何か? また、与えられたプライバシー水準下でユーティリティ損失を最小化する設定はどれか?
  • RQ4微分プライバシーを満たすスペクトル的LDAアルゴリズムは、プライベートな変分推論を上回るモデル品質を達成できるか?
  • RQ5個人情報を漏洩させることなく、どのようにして微分プライバシー尤度推定を実現できるか?

主な発見

  • 本手法は、スペクトル的手法を用いたエンド・ツー・エンドLDA学習において、一貫性と微分プライバシーの両方について理論的保証を提供する最初のものである。
  • エッジにノイズを注入する4つの異なる設定が同定され、合成則および事後処理の定理を用いて、エンド・ツー・エンドの微分プライバシーが保証された。
  • 行列およびテンソルノルムの不等式を用いて各エッジの感度を上限づけ、任意の(ε,δ)-微分プライバシー水準に対して正確なノイズキャリブレーションが可能となった。
  • 各設定におけるユーティリティ損失は、注入ノイズの関数として定量化され、与えられたプライバシー予算に対して最適な設定の選択が可能となった。
  • プライバシー制約下で、尤度およびトピックの整合性という指標において、微分プライバシーを満たす変分推論を体系的に上回るモデル品質を達成した。
  • Wikipediaデータセットを用いた実験では、ε=1の条件下で「軍事作戦」や「クラシック音楽」のような整合性のあるトピックが回復され、実用的有用性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。