Skip to main content
QUICK REVIEW

[論文レビュー] Large Scale Private Learning via Low-rank Reparametrization

Dahua Yu, Huishuai Zhang|arXiv (Cornell University)|Jun 17, 2021
Privacy-Preserving Technologies in Data参考文献 62被引用数 14
ひとこと要約

本稿では、メモリ使用量の削減とノイズの次元依存性の解消により、BERTのような大規模モデルにおける微分プライバシー付きSGDを可能にする低ランク再パラメータ化手法である再パラメータ化勾配摂動(RGP)を提案する。RGPはε=8の条件下で4つのNLPタスクにおいて平均83.9%の精度を達成し、非プライベートベースラインの5%以内に留まる。また、メンバーシップ推定攻撃を防止する。

ABSTRACT

We propose a reparametrization scheme to address the challenges of applying differentially private SGD on large neural networks, which are 1) the huge memory cost of storing individual gradients, 2) the added noise suffering notorious dimensional dependence. Specifically, we reparametrize each weight matrix with two \emph{gradient-carrier} matrices of small dimension and a \emph{residual weight} matrix. We argue that such reparametrization keeps the forward/backward process unchanged while enabling us to compute the projected gradient without computing the gradient itself. To learn with differential privacy, we design \emph{reparametrized gradient perturbation (RGP)} that perturbs the gradients on gradient-carrier matrices and reconstructs an update for the original weight from the noisy gradients. Importantly, we use historical updates to find the gradient-carrier matrices, whose optimality is rigorously justified under linear regression and empirically verified with deep learning tasks. RGP significantly reduces the memory cost and improves the utility. For example, we are the first able to apply differential privacy on the BERT model and achieve an average accuracy of $83.9\%$ on four downstream tasks with $ε=8$, which is within $5\%$ loss compared to the non-private baseline but enjoys much lower privacy leakage risk.

研究の動機と目的

  • 大規模なディープニューラルネットワークにおける微分プライバシー付きSGDの高いメモリコストと低い性能を解決すること。
  • モデルサイズが増加するにつれて性能が低下する勾配摂動における次元依存性のノイズを克服すること。
  • BERTのような大規模モデルのプライバシー保護付き学習を可能にすること。これは、従来、メモリとノイズの制約により実現不可能であった。
  • モデルの挙動を保持しつつ、効率的かつプライベートな勾配計算と更新を可能にする再パラメータ化スキームを開発すること。
  • 歴史的更新を用いて微分プライバシー下での最適勾配キャリアを近似できることを示し、性能とプライバシーを両立させること。

提案手法

  • 各重み行列 𝐖 を 𝐖 = 𝐋𝐑 + 𝐖̃ として再パラメータ化し、𝐿 と 𝐑 を低ランクの勾配キャリア、𝐖̃ を残差重みとする。これにより、順伝播・逆伝播が維持される。
  • 𝐿 と 𝐑 における勾配を用いて、𝑊 の勾配を明示的に計算せずに、元の勾配の射影を計算することで、メモリを節約する。
  • 勾配クリッピングとノイズ注入を、低次元の 𝐋 と 𝐑 行列にのみ適用することで、合計ノイズ強度を低減する。
  • 𝐿 と 𝐑 におけるノイズ付き勾配から最終的な重み更新を構築し、プライバシーを確保しながらモデル性能を維持する。
  • 既に公開済みの歴史的モデル更新を用いて、𝐿 と 𝐑 の主成分の特徴ベクトルを計算し、後処理によるプライバシー保証を活用する。
  • 線形回帰の下で理論的にこのアプローチの最適性を正当化し、ディープラーニングの文脈でも実験的に有効であることを示す。

実験結果

リサーチクエスチョン

  • RQ1低ランク再パラメータ化は、微分プライバシー付きSGDにおける個々の勾配の保存に必要なメモリコストを削減できるか?
  • RQ2全重み行列ではなく低ランクキャリア上で勾配を摂動することで、大規模モデルにおけるノイズ強度を低減し、性能を向上させられるか?
  • RQ3プライバシーを侵害せずに、歴史的モデル更新を用いて最適な勾配キャリアを近似できるか?
  • RQ4BERTのような大規模モデルをDP制約下で学習する際、RGPはどの程度モデルの性能を維持できるか?
  • RQ5RGPはプライベートモデルにおけるメンバーシップ推定攻撃を効果的に防止できるか?

主な発見

  • RGPは、BERTモデルに対する微分プライバシーの適用を初めて成功させ、4つの下流NLPタスクにおいてε=8の条件下で平均83.9%の精度を達成した。
  • RGPで学習されたBERTモデルにおけるメンバーシップ推定攻撃の成功率は約50%であり、顕著なプライバシー漏洩は認められない。一方、非プライベートモデルでは55–60%の攻撃成功率を示した。
  • 低ランク再パラメータ化のみで学習されたモデルも、標準モデルよりもメンバーシップ推定の成功率が低く、内在的なプライバシー利点があることが示された。
  • 深層ネットワークの各層の勾配は、実験的に低安定ランクであることが確認され、RGPの背後にある低ランク仮定が妥当であることが裏付けられた。
  • 線形回帰において、歴史的更新を用いた主成分勾配部分空間の近似は理論的に正当化され、ディープラーニングの文脈でも実験的に有効であることが示された。
  • RGPは、標準的なDP-SGDと比較して、合計ノイズ強度を顕著に低減し、プライベート学習における有名な次元依存性の問題を解消した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。