[論文レビュー] Input Perturbation: A New Paradigm between Central and Local Differential Privacy
本稿では、学習データに直接ガウスノイズを追加することで、データ、勾配、最終モデルパラメータを同時に保護する、新たな微分プライバシー手法としての入力摂動を提案する。この手法は、モデルに対して(ε, δ)-微分プライバシーを達成し、最先端の中央型手法と同等またはそれ以上の性能を発揮する。精度を犠牲にすることなく、エンド・ツー・エンドのプライバシーを強化する。
Traditionally, there are two models on differential privacy: the central model and the local model. The central model focuses on the machine learning model and the local model focuses on the training data. In this paper, we study the extit{input perturbation} method in differentially private empirical risk minimization (DP-ERM), preserving privacy of the central model. By adding noise to the original training data and training with the `perturbed data', we achieve ($ε$,$δ$)-differential privacy on the final model, along with some kind of privacy on the original data. We observe that there is an interesting connection between the local model and the central model: the perturbation on the original data causes the perturbation on the gradient, and finally the model parameters. This observation means that our method builds a bridge between local and central model, protecting the data, the gradient and the model simultaneously, which is more superior than previous central methods. Detailed theoretical analysis and experiments show that our method achieves almost the same (or even better) performance as some of the best previous central methods with more protections on privacy, which is an attractive result. Moreover, we extend our method to a more general case: the loss function satisfies the Polyak-Lojasiewicz condition, which is more general than strong convexity, the constraint on the loss function in most previous work.
研究の動機と目的
- 従来の中央型微分プライバシーにおいて、モデルレベルのプライバシーは保証されるが元のデータが保護されないというプライバシーのギャップを是正すること。
- ローカル型と中央型微分プライバシーのギャップを埋めるために、入力ノイズが勾配を介して最終モデルに伝播することを示すこと。
- 最適化手法に依存しない一般化可能な手法を開発し、データ、勾配、モデルパラメータの各段階でプライバシーを維持すること。
- 強い凸性を仮定する損失関数にとどまらず、より一般的なポリャク=ロジャシュエヴィチ(PL)条件を満たす損失関数へとこの手法を拡張すること。
- 入力摂動が、既存の中央型手法と同等またはそれ以上の性能を発揮する一方で、より強いエンド・ツー・エンドのプライバシー保証を提供することを経験的に検証すること。
提案手法
- モデル学習の前に、各元の学習データポイントに平均0のガウスノイズを追加し、入力レベルのプライバシーを確保する。
- 入力ノイズが最適化プロセスを通じて伝播する仕組みを活用する:入力のノイズが勾配と最終モデルパラメータのノイズを誘発する。
- 勾配の感度とモデル更新の感度に基づき、最終モデルに対する(ε, δ)-微分プライバシーの保証を形式化する。
- 理論的分析により、入力摂動が勾配とパラメータの摂動を通じてモデルに対する微分プライバシーを誘導することを示し、ローカル型と中央型モデルの間のプライバシーの橋渡しを実現する。
- 強い凸性よりも弱いがより広く適用可能なポリャク=ロジャシュエヴィチ(PL)条件を満たす損失関数へとフレームワークを拡張する。
- ハイパーパrameter T と α のチューニングに交差検証を用い、実データセット上でロジスティック回帰とMLPモデルの両方で性能を評価する。
実験結果
リサーチクエスチョン
- RQ1入力摂動は、元のデータのプライバシーを保ちながら、最終モデルに対して(ε, δ)-微分プライバシーを達成できるか?
- RQ2従来の中央型手法と比較して、入力摂動は勾配とモデルパラメータの分布にどのように影響を与えるか?
- RQ3入力摂動は、勾配摂動(Bassily et al., 2014)や出力摂動(Wang et al., 2017)といった既存の中央型DP-ERM手法と同等またはそれ以上の性能を達成できるか?
- RQ4この手法は、強い凸性を満たさない損失関数、例えばポリャク=ロジャシュエヴィチ(PL)条件を満たすものへと拡張可能か?
- RQ5さまざまなデータセットとモデルにおいて、プライバシー予算εとモデルの精度の間の経験的トレードオフは何か?
主な発見
- 提案手法の入力摂動は、精度と最適性ギャップの観点で、Bassily et al. (2014) の勾配摂動やWang et al. (2017) の出力摂動といった最先端の中央型手法と同等またはそれ以上の性能を発揮する。
- 大多数のデータセットにおいて、提案手法の精度は非プライベートなERMベースラインとほとんど同一であり、性能の低下が最小限に抑えられていることが示された。
- 提案手法の最適性ギャップは、Bassily et al. (2014) や Kifer et al. (2012) の手法よりも一貫して低く、よりタイトなノイズバウンドのおかげである。
- 本手法はデータセット間で安定した性能を示し、精度と最適性ギャップの変動が小さく、Bassily et al. (2014) の勾配摂動手法とは異なり、緩いノイズバウンドのための急激な性能低下を示さない。
- 小規模データセット(サイズ < 1000)においても、本手法は強力な性能を維持しており、低データ環境下でも有効であることが確認された。
- 本手法はエンド・ツー・エンドのプライバシー保護を提供する:元のデータ、勾配、最終モデルがすべて摂動されているため、従来の中央型モデルよりも強いプライバシー保証を提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。