Skip to main content
QUICK REVIEW

[論文レビュー] Privacy of Noisy Stochastic Gradient Descent: More Iterations without More Privacy Loss

Jason M. Altschuler, Kunal Talwar|arXiv (Cornell University)|May 27, 2022
Privacy-Preserving Technologies in Data被引用数 9
ひとこと要約

この論文は、反復回数の増加に伴いプライバシー損失が無限大に発散しないことを示すことで、微分プライバシー分野における長年の未解決問題を解決した。具体的には、ノイズ付き確率的勾配降下法(Noisy-SGD)は、短期間のバーンイン期間を経てプライバシー損失が飽和することを示した。著者らは、新たな技術である「反復によるプライバシー拡張」と「サンプリングによるプライバシー拡張」を用いて、タイトなプライバシー境界を確立した。これにより、長期間の学習がプライバシーを損なうという従来の分析とは対照的に、初期段階を除きプライバシー損失が増大しないことが示された。

ABSTRACT

A central issue in machine learning is how to train models on sensitive user data. Industry has widely adopted a simple algorithm: Stochastic Gradient Descent with noise (a.k.a. Stochastic Gradient Langevin Dynamics). However, foundational theoretical questions about this algorithm's privacy loss remain open -- even in the seemingly simple setting of smooth convex losses over a bounded domain. Our main result resolves these questions: for a large range of parameters, we characterize the differential privacy up to a constant factor. This result reveals that all previous analyses for this setting have the wrong qualitative behavior. Specifically, while previous privacy analyses increase ad infinitum in the number of iterations, we show that after a small burn-in period, running SGD longer leaks no further privacy. Our analysis departs from previous approaches based on fast mixing, instead using techniques based on optimal transport (namely, Privacy Amplification by Iteration) and the Sampled Gaussian Mechanism (namely, Privacy Amplification by Sampling). Our techniques readily extend to other settings, e.g., strongly convex losses, non-uniform stepsizes, arbitrary batch sizes, and random or cyclic choice of batches.

研究の動機と目的

  • Noisy-SGDのプライバシー損失が反復回数の増加に伴い無限に増大し続けるかどうかという根本的な未解決問題を解消すること。
  • 有界領域上の滑らかな凸関数設定において、Noisy-SGDの微分プライバシーのパラメータをタイトに特徴づけること。
  • 反復回数の増加に伴いプライバシー劣化が無限に増大すると誤って予測する従来の分析を検証・是正すること。
  • 理想化された仮定にとらわれず、非一様ステップサイズ、任意のバッチサイズ、サイクル的更新を含む多様な状況に適用可能な厳密な理論枠組みを構築すること。

提案手法

  • 著者らは、隣接するデータセットにおけるNoisy-SGDの軌道間の差異を最適輸送を用いて制限する、新たなプライバシー解析フレームワーク「反復によるプライバシー拡張」を導入した。
  • これに加え、「サンプリングによるプライバシー拡張」を組み合わせることで、反復回数Tが増加しても変化しない、タイトなリーマン微分プライバシー(RDP)境界を導出した。
  • この手法では、ノイズを初期段階用と後続段階用の2つの成分に分解し、Tに比例して増大しない非自明な境界を実現した。
  • 主な技術的イノベーションとして、時間に依存するノイズ分布のパrameterizationを用いて、アルゴリズムの軌道の収縮をモデル化した。
  • 反復によるプライバシー拡張の原理を精緻に応用することで、強い凸損失関数、非一様ステップサイズ、サイクル的バッチ更新に対しても解析を拡張した。
  • プライバシー境界の数値計算は、ノイズ分解における三択探索と、臨界反復回数T̃の閉形式最適化により可能となった。

実験結果

リサーチクエスチョン

  • RQ1反復回数Tの増加に伴い、Noisy-SGDのプライバシー損失は無限に増大し続けるのか?
  • RQ2初期バーンイン期間を除き、変化しない非自明なプライバシー境界をNoisy-SGDに対してタイトに導出できるか?
  • RQ3コンポジションと高速混合仮定に基づく従来のプライバシー解析は、時間経過に伴うプライバシー劣化の予測において根本的に誤った予測を下しているのか?
  • RQ4反復によるプライバシー拡張技術は、Noisy-SGDにおけるi.i.d.でない、非定常な更新シーケンスに対しても効果的に適用可能か?
  • RQ5ステップサイズ、バッチサイズ、更新順序(サイクル的 vs. ランダム)の変動に強く、ロバストなプライバシー境界を導出することは可能か?

主な発見

  • Noisy-SGDのプライバシー損失は反復回数の増加に伴い無限に増大しない。代わりに、小さなバーンイン期間を経て飽和する。これは、従来の解析が予測した無限増大とは対照的である。
  • 有界領域上の滑らかな凸損失関数に対しては、リーマン微分プライバシー(RDP)のパラメータεは、Tに依存しない定数で抑えられ、定数倍の要因を除けばTとは無関係である。
  • 提案された境界はタイトであり、実際の実験で観察される挙動と一致しており、長期間の学習がプライバシーを悪化させないことを裏付けている。
  • 解析から、コンポジションと高速混合仮定に基づく従来の手法は、プライバシー劣化の時間的推移に関して根本的に誤った予測を下していることが明らかになった。
  • 境界は多様な設定に適用可能である。強いつよさのある凸損失関数、非一様ステップサイズ、任意のバッチサイズ、およびランダム・サイクル両方のバッチ選択に有効である。
  • プライバシー境界の数値計算は効率的であり、大規模なTに対しても最小限のプライバシーコストで実用的導入が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。