Skip to main content
QUICK REVIEW

[論文レビュー] Fine-Tuning with Differential Privacy Necessitates an Additional Hyperparameter Search

Yannis Cattan, Christopher A. Choquette-Choo|arXiv (Cornell University)|Oct 5, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

この論文は、微調整の際、全モデルや最後のレイヤーのみではなく、事前学習モデルの最初と最後のレイヤーのみを微調整することで、プライバシーと精度のトレードオフを顕著に改善することを提案する。DP-SGDにおけるノイズの影響を受けるトレーニング可能なパラメータ数を減らすことで、最先端の性能を達成しており、(ε=2, δ=10⁻⁵)-DPのもとでCIFAR-100で77.9%の精度を達成し、先行手法を最大3.2ポイント上回っている。

ABSTRACT

Models need to be trained with privacy-preserving learning algorithms to prevent leakage of possibly sensitive information contained in their training data. However, canonical algorithms like differentially private stochastic gradient descent (DP-SGD) do not benefit from model scale in the same way as non-private learning. This manifests itself in the form of unappealing tradeoffs between privacy and utility (accuracy) when using DP-SGD on complex tasks. To remediate this tension, a paradigm is emerging: fine-tuning with differential privacy from a model pretrained on public (i.e., non-sensitive) training data. In this work, we identify an oversight of existing approaches for differentially private fine tuning. They do not tailor the fine-tuning approach to the specifics of learning with privacy. Our main result is to show how carefully selecting the layers being fine-tuned in the pretrained neural network allows us to establish new state-of-the-art tradeoffs between privacy and accuracy. For instance, we achieve 77.9% accuracy for $(\varepsilon, δ)=(2, 10^{-5})$ on CIFAR-100 for a model pretrained on ImageNet. Our work calls for additional hyperparameter search to configure the differentially private fine-tuning procedure itself.

研究の動機と目的

  • 既存のプライベートな学習に特化した微調整手法が、プライベート学習の独自の制約に最適化されているかどうかを調査すること。
  • モデルサイズの増加に伴いノイズスケーリングが増加する(sqrt(d)ノイズ成長)DP-SGDにおける性能低下を是正すること。
  • 特定のレイヤーのみを微調整することで、追加のハイパーパrameterチューニング(レイヤー選択以外)を必要とせずにプライバシーとユーティリティのトレードオフを緩和できるかどうかを検討すること。
  • 最小限のアーキテクチャ変更で、視覚ベンチマークにおけるプライバシーと精度の性能の新記録を確立すること。

提案手法

  • 事前学習済みニューラルネットワークの最初と最後のレイヤーのみを微調整し、他のすべてのレイヤーは固定する。
  • このアプローチにより、DP-SGDにおける差分プライバシーのノイズが影響を受けるパラメータ総数が削減され、結果として有効なノイズの大きさが低減される。
  • 残りのトレーニング可能なパラメータに合わせてノイズスケーリングを調整した標準的なDP-SGDを適用し、(ε,δ)-DPの保証を維持する。
  • 過去の研究と同一の実験設定(28-10 Wide-ResNetという同じモデルアーキテクチャとCIFAR-10, CIFAR-100という同じデータセット)で評価する。
  • 全モデル微調整と最後のレイヤーのみ微調整の2つのベースラインと比較し、他のハイパーパramータはすべて同一に保つ。

実験結果

リサーチクエスチョン

  • RQ1事前学習モデルの最初と最後のレイヤーのみを部分的に微調整することで、プライバシーと精度のトレードオフが改善されるか?
  • RQ2DP微調整におけるトレーニング可能なパラメータ数を減らすことで、DP-SGDに内在するノイズスケーリング問題を緩和できるか?
  • RQ3最初と最後のレイヤーのみを微調整する戦略による性能向上は、さまざまなプライバシー予算とデータセットで一貫して得られるか?
  • RQ4全レイヤーまたは最後のレイヤーのみを微調整する従来の手法が、なぜこの選択的戦略に比べて性能が劣るのか?

主な発見

  • 提案手法である最初と最後のレイヤーの微調整により、(ε=2, δ=10⁻⁵)-DPのもとでCIFAR-100でトップ-1精度77.9%を達成し、先行の最良手法(74.7%)を最大3.2ポイント上回った。
  • CIFAR-10では(ε=8, δ=10⁻⁵)-DPのもとで96.4%の精度を達成し、全モデル微調整および最後のレイヤーのみ微調整の両方を上回った。
  • 低プライバシー予算(ε=1)の条件下で特に顕著な向上が見られ、CIFAR-100では3.4ポイントの向上を記録した。
  • CIFAR-10とCIFAR-100の両方で、評価されたすべてのプライバシー予算において、全モデル微調整および最後のレイヤー微調整を一貫して上回った。
  • 他のハイパーパラメータを一切変更せず、レイヤー選択がDP微調整における重要な、かつこれまでに見過ごされていたハイパーパラメータであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。