Skip to main content
QUICK REVIEW

[論文レビュー] Bypassing the Ambient Dimension: Private SGD with Gradient Subspace Identification

Yingxue Zhou, Steven Z. Wu|arXiv (Cornell University)|Jul 7, 2020
Privacy-Preserving Technologies in Data参考文献 33被引用数 20
ひとこと要約

本稿では、少量の公開データセットから特定された低次元部分空間に勾配更新を投影することにより、ノイズを低減する新しい差分プライバシー最適化手法「Projected DP-SGD」を提案する。深層ネットワーク勾配の固有の低次元構造を活用することで、プライバシー損失を増加させることなく、特に高いプライバシー制約下でも顕著に向上したモデル精度を達成する。これは、標準的な DP-SGD に内在する環境次元依存性を回避するものである。

ABSTRACT

Differentially private SGD (DP-SGD) is one of the most popular methods for solving differentially private empirical risk minimization (ERM). Due to its noisy perturbation on each gradient update, the error rate of DP-SGD scales with the ambient dimension $p$, the number of parameters in the model. Such dependence can be problematic for over-parameterized models where $p \\gg n$, the number of training samples. Existing lower bounds on private ERM show that such dependence on $p$ is inevitable in the worst case. In this paper, we circumvent the dependence on the ambient dimension by leveraging a low-dimensional structure of gradient space in deep networks -- that is, the stochastic gradients for deep nets usually stay in a low dimensional subspace in the training process. We propose Projected DP-SGD that performs noise reduction by projecting the noisy gradients to a low-dimensional subspace, which is given by the top gradient eigenspace on a small public dataset. We provide a general sample complexity analysis on the public dataset for the gradient subspace identification problem and demonstrate that under certain low-dimensional assumptions the public sample complexity only grows logarithmically in $p$. Finally, we provide a theoretical analysis and empirical evaluations to show that our method can substantially improve the accuracy of DP-SGD in the high privacy regime (corresponding to low privacy loss $\\epsilon$).

研究の動機と目的

  • パrameter数 p が訓練サンプル数 n よりも著しく大きい過パラメータ化モデルにおいて、DP-SGD の高い誤差率を是正すること。
  • 深層ニューラルネットワークの勾配空間における低次元構造を活用することで、DP-SGD に内在する p に依存する誤差スケーリングを克服すること。
  • 小さな公開データセットを用いて低次元勾配部分空間を特定し、ノイズ低減を実現する実用的なプライベート最適化フレームワークを開発すること。
  • 低次元仮定の下で、部分空間同定のための公開データのサンプル必要数が p の対数関数的に増加することを示すこと。
  • 実験的に、本手法が高プライバシー設定下での一般化性能とプライバシー・精度のトレードオフを改善することを検証すること。

提案手法

  • 本手法は、公開データセット上で計算された勾配2階モーメント行列の上位 k 個の固有ベクトルが張る低次元部分空間に、ノイズを含む勾配を投影する「Projected DP-SGD」を導入する。
  • 勾配部分空間は、小さな公開データセット S_h からの勾配共分散行列の上位 k 個の固有空間を用いて特定され、プライバシー予算を増加させることなくノイズの影響を低減する。
  • アルゴリズムは、p 次元空間にノイズを注入したプライベート SGD を実行し、その後、再構成誤差を最小化するように k 次元部分空間に投影する。
  • 勾配構造の変化に適応するため、部分空間は定期的に(例:s 回ごとに)更新され、計算コストを削減する。
  • 理論的分析により、低ランク勾配仮定の下で、正確な部分空間同定のための公開データのサンプル必要数が p の対数関数的に増加することが示された。
  • 本手法はモジュラーであり、既存の DP-SGD 実装に、標準的な勾配ノイズ注入を部分空間投影ノイズに置き換えることで統合可能である。

実験結果

リサーチクエスチョン

  • RQ1深層ネットワーク勾配における低次元構造を活用することで、DP-SGD の環境次元依存性を軽減できるか?
  • RQ2小さな公開データセットを用いて勾配部分空間を同定することで、プライベート学習における一般化性能が向上するか?
  • RQ3公開データセットのサイズが、部分空間同定プロセスの精度と安定性にどのように影響するか?
  • RQ4部分空間の更新頻度を低くすることで、計算コストと性能のトレードオフはどのように変化するか?
  • RQ5高プライバシー環境下で、本手法は標準的な DP-SGD よりも優れたプライバシー・精度トレードオフを達成できるか?

主な発見

  • k=50 の Projected DP-SGD は、25,000 個のパラメータからなる部分空間に勾配を投影しても、MNIST および Fashion-MNIST で標準的な DP-SGD よりも高いテスト精度を達成した。
  • ε=0.23 の場合、m=150 の公開サンプルを用いた PDP-SGD は、DP-SGD を上回り、m=50 の場合よりも高い精度を示した。これは、より大きな公開データにより部分空間推定が改善されたことを示している。
  • k=50 の PDP-SGD は、再構成誤差とノイズ低減のバランスが優れているため、他の k 値(10, 20, 30)を上回る一貫した性能を示した。
  • 部分空間の更新頻度を低下させること(例:10 回または 20 回ごとに更新)しても、精度の低下はわずかであり、顕著な計算コストの削減が可能である。
  • 高プライバシー環境(低 ε)では、PDP-SGD が DP-SGD より顕著にモデル精度を向上させ、部分空間への投影による効果的なノイズ低減が実証された。
  • 実験結果により、深層ネットワークにおける勾配方向が低次元部分空間に存在することが確認され、本手法の根幹となる仮定が妥当であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。