[論文レビュー] Fast and Memory Efficient Differentially Private-SGD via JL Projections
本稿では、ジョンソン=リンデンストラウス(JL)射影を用いて各サンプルの勾配ノルムを近似することで、計算コストとメモリ使用量を著しく削減しながらもプライバシーを保証する、差分プライバシー最適化手法 DP-SGD-JL および DP-Adam-JL を提案する。この手法は、非プライベートな SGD と同等の学習速度とメモリ使用量を達成しており、f-DP フレームワークを用いたプライバシー保証を備え、IMDb LSTM ベンチマークにおいてプライバシーと精度のトレードオフを損なわず、顕著な高速化を実現する。
Differentially Private-SGD (DP-SGD) of Abadi et al. (2016) and its variations are the only known algorithms for private training of large scale neural networks. This algorithm requires computation of per-sample gradients norms which is extremely slow and memory intensive in practice. In this paper, we present a new framework to design differentially private optimizers called DP-SGD-JL and DP-Adam-JL. Our approach uses Johnson-Lindenstrauss (JL) projections to quickly approximate the per-sample gradient norms without exactly computing them, thus making the training time and memory requirements of our optimizers closer to that of their non-DP versions. Unlike previous attempts to make DP-SGD faster which work only on a subset of network architectures or use compiler techniques, we propose an algorithmic solution which works for any network in a black-box manner which is the main contribution of this paper. To illustrate this, on IMDb dataset, we train a Recurrent Neural Network (RNN) to achieve good privacy-vs-accuracy tradeoff, while being significantly faster than DP-SGD and with a similar memory footprint as non-private SGD. The privacy analysis of our algorithms is more involved than DP-SGD, we use the recently proposed f-DP framework of Dong et al. (2019) to prove privacy.
研究の動機と目的
- 標準的な DP-SGD における各サンプルの勾配ノルム計算に伴う高い計算コストとメモリ使用量の問題に対処し、大規模なディープラーニングにおける実用的利用を制限する要因を解消すること。
- コンパイラー最適化やアーキテクチャ固有の変更に依存せずに、差分プライバシー学習の高速化を実現するアルゴリズム的解決策を設計すること。
- f-DP フレームワークを用いて強いプライバシー保証を維持するとともに、速度とメモリ使用量の面で非プライベートな SGD に近いパフォーマンスを達成すること。
- IMDb などのプライベートデータセット上で、RNN などの複雑なモデルのハイパーパramータ探索とトレーニングを効率的に行えるようにすること。
提案手法
- 各サンプルの勾配 ℓ₂ ノルムを正確に計算せずに、確率的推定のためにジョンソン=リンデンストラウス(JL)射影を用いる。
- 勾配のランダム部分空間にJL射影を適用することで、誤差を制御しつつ、勾配ノルムの高速な近似を実現する。
- JLに基づくノルム推定を、DP-SGD および DP-Adam フレームワークに統合し、正確な各サンプルの勾配ノルム計算を置き換える。
- Dong ら(2019)の f-DP フレームワークを用いて、JL 射影による誤差を考慮した形式的なプライバシー解析を実施する。
- 適応的合成とサブサンプリング技術を用いて、f-DP フレームワーク下でのエンドツーエンドのプライバシー境界を導出する。
- 合成定理下で可能な限りタイトなプライバシー曲線を計算するために、二重の凸共役(**)を用いる。
実験結果
リサーチクエスチョン
- RQ1JL 射影を用いて DP-SGD における各サンプルの勾配ノルムを近似することで、プライバシーや精度に顕著な影響を与えることなく実現可能か?
- RQ2提案された DP-SGD-JL 法は、強いプライバシー保証を維持しつつ、非プライベートな SGD と同等の学習速度とメモリ使用量を達成できるか?
- RQ3JL の次元の選択が、得られるモデルのプライバシーと精度のトレードオフにどのように影響するか?
- RQ4f-DP フレームワークは、確率的ノルム推定を用いる差分プライバシー最適化手法のプライバシーを効果的に分析できるか?
- RQ5DP-SGD-JL は、IMDb のようなプライベートデータセット上で RNN などの複雑なモデルのハイパーパramータ探索とトレーニングに適しているか?
主な発見
- IMDb データセットにおいて、DP-SGD-JL は標準的な DP-SGD よりも顕著に高速に LSTM モデルをトレーニングし、非プライベートな SGD と同程度のメモリ使用量を維持する。
- プライバシーパラメータ ε は、JL の次元が増加するにつれて単調に減少し、JL 次元が大きくなると、通常の DP-SGD の ε に収束する。
- IMDb RNN ベンチマークにおいて、DP-SGD-JL はプライバシーと精度のトレードオフに優れた性能を示し、標準的な DP-SGD よりもトレーニング効率が優れている。
- f-DP を用いた理論的プライバシー解析により、JL 射影による誤差が有界であり、全体のプライバシー保証を損なわないことが示された。
- アルゴリズムはアーキテクチャに依存せず、さまざまなニューラルネットワークタイプに対して、DP-SGD のブラックボックス代替として機能する。
- 数値的評価により、f-DP と JL 射影誤差を用いて導出されたプライバシー曲線が、単純な近似よりもタイトであることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。