Skip to main content
QUICK REVIEW

[論文レビュー] A Differentially Private Text Perturbation Method Using a Regularized Mahalanobis Metric

Zekun Xu, Abhinav Aggarwal|arXiv (Cornell University)|Oct 22, 2020
Privacy-Preserving Technologies in Data参考文献 42被引用数 4
ひとこと要約

本稿では、語彙の単語埋め込み共分散構造に基づいてノイズのスケールを適応的にスケーリングする正則化されたマハラノビス距離を用いた、微分プライバシー化されたテキスト摂動手法を提案する。この手法により、スパース領域におけるプライバシーを向上させつつ、ユーティリティを損なわずに済ます。マルチバリアテ・ラプラス機構と比較して、はるかに優れたプライバシー統計(低い語非置換率と高い置換多様性)を達成しており、同時に下流分類タスクの性能は同等を維持する。

ABSTRACT

Balancing the privacy-utility tradeoff is a crucial requirement of many practical machine learning systems that deal with sensitive customer data. A popular approach for privacy-preserving text analysis is noise injection, in which text data is first mapped into a continuous embedding space, perturbed by sampling a spherical noise from an appropriate distribution, and then projected back to the discrete vocabulary space. While this allows the perturbation to admit the required metric differential privacy, often the utility of downstream tasks modeled on this perturbed data is low because the spherical noise does not account for the variability in the density around different words in the embedding space. In particular, words in a sparse region are likely unchanged even when the noise scale is large. %Using the global sensitivity of the mechanism can potentially add too much noise to the words in the dense regions of the embedding space, causing a high utility loss, whereas using local sensitivity can leak information through the scale of the noise added. In this paper, we propose a text perturbation mechanism based on a carefully designed regularized variant of the Mahalanobis metric to overcome this problem. For any given noise scale, this metric adds an elliptical noise to account for the covariance structure in the embedding space. This heterogeneity in the noise scale along different directions helps ensure that the words in the sparse region have sufficient likelihood of replacement without sacrificing the overall utility. We provide a text-perturbation algorithm based on this metric and formally prove its privacy guarantees. Additionally, we empirically show that our mechanism improves the privacy statistics to achieve the same level of utility as compared to the state-of-the-art Laplace mechanism.

研究の動機と目的

  • テキストデータの摂動におけるプライバシーとユーティリティのトレードオフを解消すること、特に埋め込み空間の低密度領域に位置する語に対して焦点を当てる。
  • 球対称ノイズが多変量ラプラス機構において、高いノイズスケールであってもスパース領域の語を効果的に摂動できないという限界を克服すること。
  • 語の埋め込みの内在的共分散構造を考慮したノイズ機構を設計し、スパース領域における置換の可能性を向上させること。
  • 提案されたマハラノビスに基づく摂動機構におけるメトリック微分プライバシーの形式的証明を行うこと。
  • 提案手法が、最先端のラプラス機構と同等のプライバシー予算下で、ユーティリティを維持しつつプライバシー統計を向上させることを実証的に検証すること。

提案手法

  • テキストを連続的単語埋め込みにマッピングし、局所的な埋め込み共分散に応じてノイズスケールを補正する正則化されたマハラノビスノルムを用いて楕円的ノイズを適用する。
  • マハラノビス距離は語彙の単語埋め込みのグローバル共分散行列から導出され、分散が大きい方向にノイズを引き伸ばすことで、スパース領域における摂動を強化する。
  • スパースデータに対する過剰適合を防ぐために、マハラノビス距離に正則化項を導入し、逆共分散推定を安定化させる。
  • 正則化されたマハラノビス距離で定義される共分散構造を持つ多変量ラプラス分布からノイズをサンプリングし、メトリック微分プライバシーを保証する。
  • 摂動された埋め込みを、最近傍探索を用いて離散語彙空間に再投影する。
  • プライバシー予算 ε はグローバル感度を用いてキャリブレーションされ、調整パラメータ λ が正則化強度を制御する。

実験結果

リサーチクエスチョン

  • RQ1マハラノビスに基づくノイズ機構は、埋め込み空間の共分散構造に適合させることで、テキスト摂動におけるプライバシー統計を向上させ得るか?
  • RQ2提案された機構は、多変量ラプラス機構における球対称ノイズと比較して、スパースな埋め込み領域の語の置換率をより高め得るか?
  • RQ3マハラノビス機構は、同等のプライバシー予算下で、ラプラス機構と比較して下流タスクのユーティリティをどの程度維持できるか?
  • RQ4正則化パラメータ λ は、提案フレームワークにおけるプライバシーとユーティリティのトレードオフにどのように影響を与えるか?
  • RQ5マハラノビス機構は、語クラスタごとのローカル共分散推定に拡張可能であり、個別化を向上させ得るか?

主な発見

  • マハラノビス機構は、すべてのプライバシー予算において、非置換語数(Nw)の平均を著しく低減し、異なる置換数(Sw)の平均を増加させた。特に ε = 5, 10, 20 の中程度の ε 範囲で顕著な改善が得られた。
  • ε = 10 の場合、マハラノビス機構は平均 Nw 12.3、平均 Sw 87.7 を達成した。一方、ラプラス機構は 28.1 と 71.9 であった。95%信頼区間により、統計的有意性が確認された。
  • Twitter および SMSSpam データセットにおいて、分類精度、適合率、再現率は、すべての ε および λ 値において両機構でほぼ同一であった。これにより、ユーティリティが維持されていることが示された。
  • 同じノイズスケール下で、マルチバリアテ・ラプラス機構よりも優れたプライバシー統計を達成しており、ユーティリティの損失なしに、より高いプライバシー保証が得られた。
  • 300次元の GloVe および FastText 埋め込みの両方で、プライバシー指標の改善が一貫して得られた。これにより、本手法の埋め込みタイプに依存しない頑健性が検証された。
  • 正則化パラメータ λ は、プライバシーとユーティリティのトレードオフを調整するのに有効であった。[0,1] のグリッドサーチで十分な最適化が可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。