Skip to main content
QUICK REVIEW

[論文レビュー] Tighter Generalization Bounds for Iterative Differentially Private Learning Algorithms

Fengxiang He, Bohan Wang|arXiv (Cornell University)|Jul 18, 2020
Privacy-Preserving Technologies in Data参考文献 80被引用数 6
ひとこと要約

この論文は、新たな合成定理を通じてプライバシーと一般化を結びつけることで、反復的で微分プライベートな学習アルゴリズムのよりきつい一般化バウンドを確立する。$(\varepsilon,\delta)$-微分プライバシーが、モデルサイズに依存せずに、先行研究よりも厳しく、高確率での一般化バウンドを示すことを証明し、確率的勾配ランジュヴィンダイナミクスおよびアグノスティックフェデレーテッドラーニングにこれらの結果を適用する。

ABSTRACT

This paper studies the relationship between generalization and privacy preservation in iterative learning algorithms by two sequential steps. We first establish an alignment between generalization and privacy preservation for any learning algorithm. We prove that $(\varepsilon, δ)$-differential privacy implies an on-average generalization bound for multi-database learning algorithms which further leads to a high-probability bound for any learning algorithm. This high-probability bound also implies a PAC-learnable guarantee for differentially private learning algorithms. We then investigate how the iterative nature shared by most learning algorithms influence privacy preservation and further generalization. Three composition theorems are proposed to approximate the differential privacy of any iterative algorithm through the differential privacy of its every iteration. By integrating the above two steps, we eventually deliver generalization bounds for iterative learning algorithms, which suggest one can simultaneously enhance privacy preservation and generalization. Our results are strictly tighter than the existing works. Particularly, our generalization bounds do not rely on the model size which is prohibitively large in deep learning. This sheds light to understanding the generalizability of deep learning. These results apply to a wide spectrum of learning algorithms. In this paper, we apply them to stochastic gradient Langevin dynamics and agnostic federated learning as examples.

研究の動機と目的

  • 任意の学習アルゴリズムにおける微分プライバシーと一般化の理論的リンクを確立すること。
  • 学習アルゴリズムの反復的性質がプライバシー劣化および一般化性能に与える影響を分析すること。
  • モデルサイズに依存しない、微分プライベート学習のよりきつい高確率一般化バウンドを導出すること。
  • 反復的アルゴリズムにおける累積的プライバシー損失を正確に推定する合成定理を提案すること。
  • このフレームワークが、確率的勾配ランジュヴィンダイナミクスやフェデレーテッドラーニングといった実世界のアルゴリズムへの適用可能性を示すこと。

提案手法

  • $(\varepsilon,\delta)$-微分プライバシーの下で、マルチデータベース学習アルゴリズムに対する平均一般化バウンドを導出すること。
  • 平均バウンドと集中不等式を活用して、高確率一般化バウンドを確立すること。
  • 1イテレーションごとのプライバシー予算に基づいて、反復的アルゴリズムの微分プライバシーを近似するための3つの合成定理を提案すること。
  • プライバシー一般化のリンクと合成定理を統合し、反復的学習におけるエンドツーエンド一般化バウンドを導出すること。
  • ノイズ注入と勾配クリッピングを用いて、確率的勾配ランジュヴィンダイナミクスおよびアグノスティックフェデレーテッドラーニングにフレームワークを適用すること。
  • チェルノフ不等式とモーメント生成関数を用いて、ガウス分布およびクリッピング勾配機構のプライバシーを分析すること。

実験結果

リサーチクエスチョン

  • RQ1反復的学習アルゴリズムにおける微分プライバシーと一般化誤差の関係は何か?
  • RQ2モデルサイズに依存せずに、微分プライベート学習のよりきつい高確率一般化バウンドを導出可能か?
  • RQ3反復的学習においてプライバシーはどのように劣化するのか? そして、その劣化は定量的にどのようにモデル化できるか?
  • RQ4合成定理を改善することで、反復的アルゴリズムのプライバシー推定をより厳密に行えるか?
  • RQ5提案されたバウンドは、SGLD やフェデレーテッドラーニングといった実用的アルゴリズムにおいて、一般化およびプライバシー保証をどの程度向上させるか?

主な発見

  • 高確率一般化バウンドにおける項 $a$ が $13\varepsilon$ から $9\varepsilon$ に厳しく改善され、先行研究の最良状態を上回る。
  • 失敗確率 $b$ のバウンドが $\frac{2\delta}{\varepsilon}\log\left(\frac{2}{\varepsilon}\right)$ から $\frac{2e^{-\varepsilon}\delta}{\varepsilon}\log\left(\frac{2}{\varepsilon}\right)$ に改善され、誤差確率が顕著に低減された。
  • 平均マルチデータベース一般化バウンドが、ニシムとステマー(2018)の結果よりも $e^{\varepsilon}$ の要因でよりきつくなった。
  • 提案された合成定理は、既存の結果よりも $\delta$ の近似がきつくなり、反復的アルゴリズムのプライバシー会計を改善した。
  • 導出された高確率一般化バウンドを通じて、微分プライベート学習アルゴリズムのPAC学習可能性が保証された。
  • バウンドはモデルサイズに依存しないため、モデルサイズが著しく大きいディープラーニングにおいて特に有用である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。