Skip to main content
QUICK REVIEW

[論文レビュー] On a Utilitarian Approach to Privacy Preserving Text Generation

Zekun Xu, Abhinav Aggarwal|arXiv (Cornell University)|Apr 23, 2021
Privacy-Preserving Technologies in Data参考文献 37被引用数 8
ひとこと要約

本稿では、ノイズを含む単語埋め込みのk番目の近傍から確率的に選択することで、プライバシーと有効性のトレードオフを改善する、新たな微分プライバシー付きテキスト生成手法であるVickreyメカニズムを提案する。特に、2番目の近傍に注目し、2段階入札制度を模倣したアプローチを採用している。この手法は、テキスト分類データセットにおいて、同等の実証的プライバシー保証のもとで、最先端手法に比べて最大50%高い有効性を達成する。

ABSTRACT

Differentially-private mechanisms for text generation typically add carefully calibrated noise to input words and use the nearest neighbor to the noised input as the output word. When the noise is small in magnitude, these mechanisms are susceptible to reconstruction of the original sensitive text. This is because the nearest neighbor to the noised input is likely to be the original input. To mitigate this empirical privacy risk, we propose a novel class of differentially private mechanisms that parameterizes the nearest neighbor selection criterion in traditional mechanisms. Motivated by Vickrey auction, where only the second highest price is revealed and the highest price is kept private, we balance the choice between the first and the second nearest neighbors in the proposed class of mechanisms using a tuning parameter. This parameter is selected by empirically solving a constrained optimization problem for maximizing utility, while maintaining the desired privacy guarantees. We argue that this empirical measurement framework can be used to align different mechanisms along a common benchmark for their privacy-utility tradeoff, particularly when different distance metrics are used to calibrate the amount of noise added. Our experiments on real text classification datasets show up to 50% improvement in utility compared to the existing state-of-the-art with the same empirical privacy guarantee.

研究の動機と目的

  • 既存の微分プライバシー付きテキスト生成メカニズムにおける実証的プライバシーリスクを解消すること。特に、小さなノイズが元の単語の再構築可能性を高める問題に焦点を当てる。
  • メトリック-DPテキスト生成におけるプライバシーと有効性のトレードオフを最適化できる調整可能なメカニズムを開発すること。
  • 異なる距離尺度とメカニズム間でプライバシー-有効性トレードオフを比較可能な統一的実証ベンチマークを提供すること。
  • 1番目の近傍を超えて、k ≥ 2の近傍選択を一般化する確率的フレームワークを、Vickreyオークションを模倣して開発すること。
  • 実世界のテキスト分類データセットを用いた実証的検証を通じて、既存の最先端手法を上回る優れた性能を示すこと。

提案手法

  • ノイズを含む単語埋め込みのk番目の近傍から出力単語を選択する、新たな微分プライバシー付きメカニズムクラスであるVickreyメカニズムを提案する。
  • 1番目と2番目の近傍の選択を調整可能なパラメータで制御し、2段階入札制度にインspiredされた仕組み(2番目に高い入札額のみが公開される)を模倣する。
  • k個の近傍に対して確率分布を適用し、ノイズを含む埋め込みからの距離に反比例するように選択確率を設定。調整パラメータは制約付き最適化により最適化される。
  • 事前学習済み埋め込み空間(例:GloVe、FastText)における単語埋め込み間の距離によってプライバシーを調整するメトリック-DPフレームワークを採用する。
  • k ≥ 2の近傍にまで選択を拡張する一般化されたVickreyメカニズムを導入。出力確率は逆距離の指数関数と調整パラメータに比例する。
  • 再構築リスク(プライバシー指標)と有効性損失(有効性指標)を用いてプライバシー-有効性トレードオフを実証的に評価。固定された有効性許容誤差のもとで調整パラメータを最適化する。

実験結果

リサーチクエスチョン

  • RQ11番目の近傍選択を超えて、2番目の近傍を選択することで、実証的プライバシー保証を維持したまま有効性を向上させられるか?
  • RQ21番目の近傍ではなく2番目の近傍を選択することで、テキスト生成における実証的プライバシー-有効性トレードオフにどのような影響を与えるか?
  • RQ3複数の近傍から確率的選択を行うメカニズムは、有効性を低下させることなく、どの程度プライバシーを向上させられるか?
  • RQ4GloVeとFastTextといった異なる距離尺度は、提案手法のプライバシーおよび有効性の性能にどのように影響を与えるか?
  • RQ5異なる距離尺度を用いたメトリック-DPメカニズム間で、プライバシー-有効性トレードオフを比較可能な統一的実証ベンチマークを構築できるか?

主な発見

  • 提案されたVickreyメカニズムは、実際のテキスト分類データセットにおいて、同等の実証的プライバシー保証のもとで、最先端手法に比べて最大50%の有効性向上を達成する。
  • ノイズの大きさが小さい場合、2番目の近傍選択は1番目の近傍選択メカニズムと比較して再構築リスクを顕著に低減する。
  • 3番目の近傍への拡張はわずかな改善をもたらすが、4番目および5番目の近傍への拡張は、有効性やプライバシーの面で顕著な利益をもたらさない。
  • 異なる埋め込みモデルに対して堅牢であることが示され、FastTextでは単語間の距離が小さいため、より優れたプライバシー-有効性トレードオフが得られる。
  • 実証的プライバシー指標(再構築リスク)は、理論的DPパラメータだけでは十分に反映されない現実世界のプライバシーリスクを効果的に捉えている。
  • 制約付き最適化フレームワークにより、有効性損失を事前に指定された許容範囲内に保ちながらプライバシーを最大化する最適な調整パラメータが特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。