Skip to main content
QUICK REVIEW

[論文レビュー] Large Scale Transfer Learning for Differentially Private Image Classification

Harsh Mehta, Abhradeep Thakurta|arXiv (Cornell University)|May 6, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

この論文は、大規模な転移学習が、ImageNetにおける微分プライバシー保護付き画像分類の性能を顕著に向上させることを示している。JFT-300M/4Bといった大規模な公開データセットでビジョントランスフォーマーを事前学習し、LAMB最適化手法を用いて1回のフルバッチステップで最終層のみを微調整し、近似的にゼロに近い初期化を行うことで、広いプライバシー予算範囲(ε ∈ [4,10], δ = 10⁻⁶)において、81.7%という最先端の精度を達成した。計算コストを著しく削減しながらも、強いプライバシー保証のもとで高い性能を維持した。

ABSTRACT

Differential Privacy (DP) provides a formal framework for training machine learning models with individual example level privacy. In the field of deep learning, Differentially Private Stochastic Gradient Descent (DP-SGD) has emerged as a popular private training algorithm. Unfortunately, the computational cost of training large-scale models with DP-SGD is substantially higher than non-private training. This is further exacerbated by the fact that increasing the number of parameters leads to larger degradation in utility with DP. In this work, we zoom in on the ImageNet dataset and demonstrate that, similar to the non-private case, pre-training over-parameterized models on a large public dataset can lead to substantial gains when the model is finetuned privately. Moreover, by systematically comparing private and non-private models across a range of large batch sizes, we find that similar to non-private setting, choice of optimizer can further improve performance substantially with DP. By using LAMB optimizer with DP-SGD we saw improvement of up to 20$\%$ points (absolute). Finally, we show that finetuning just the last layer for a \emph{single step} in the full batch setting, combined with extremely small-scale (near-zero) initialization leads to both SOTA results of 81.7 $\%$ under a wide privacy budget range of $ε\in [4, 10]$ and $δ$ = $10^{-6}$ while minimizing the computational overhead substantially.

研究の動機と目的

  • 転移学習を用いて、大規模なプライベート画像分類におけるプライバシーと性能のトレードオフを改善すること。
  • 大規模モデルにおける微分プライバシー訓練の高い計算コストと性能低下の問題を解決すること。
  • モデルサイズ、事前学習データの規模、最適化手法の選択、学習率や重み初期化などのハイパーパrameterがDP性能に与える影響を調査すること。
  • 強いプライバシー制約(ε ∈ [4,10], δ = 10⁻⁶)のもとで、計算オーバーヘッドを最小限に抑えつつ、モデルの精度を最大化すること。

提案手法

  • プライバシー制約なしで、大規模な公開データセット(JFT-300MおよびJFT-4B)上でビジョントランスフォーマー(ViT-H/14-4b)を事前学習する。
  • ImageNet上で、フルバッチ、1ステップ更新のDifferentially Private Stochastic Gradient Descent(DP-SGD)を用いて、事前学習モデルを微調整する。
  • 大規模バッチサイズでの収束性と性能向上を図るため、プライベート微調整中にLAMB最適化手法を適用する。
  • プライバシーと性能のトレードオフを改善するために、最終分類層の初期化を近似的にゼロまたは極めて小さな値に設定する。
  • 入力解像度(256×256)、クロッピング戦略(中央クロップ)、学習率スケーリングなどのハイパーパrameterを最適化する。
  • ノイズ乗数σを用いてプライバシー予算を制御し、標準的なDP-SGDメカニズムを用いて(ε, δ)-微分プライバシーを保証する。

実験結果

リサーチクエスチョン

  • RQ1大規模な公開データセットでの大規模事前学習が、ImageNetにおける微分プライバシー保護付き画像分類器の精度を向上させることができるか?
  • RQ2大規模バッチサイズでのDP-SGDにおいて、最適化手法の選択(例:LAMB対SGD with momentum)が性能に与える影響は何か?
  • RQ3プライベート微調整における最終層重み初期化の大きさが、最終的な精度に与える影響は何か?
  • RQ41回のステップでフルバッチの微調整を実施するプロトコルが、計算コストを最小限に抑えつつ最先端の結果を達成できるか?
  • RQ5大規模バッチでの微分プライバシー訓練において、入力解像度がモデル性能に与える影響は何か?

主な発見

  • JFT-4Bで事前学習したViT-H/14-4bを用い、最終層を1回のフルバッチステップで微調整することで、ε ∈ [4,10], δ = 10⁻⁶のもとでImageNetでトップ-1精度81.7%を達成した。
  • LAMB最適化手法を用いることで、同じプライバシー予算(ε=10, δ=10⁻⁶)のもとで、SGD with momentumに比べて最大20パーセンテージポイント(絶対値)の精度向上が達成された。
  • 最終層を近似的にゼロに近い重みで初期化することで、性能が顕著に向上した。逆に、大きな初期化値は、特にDP環境下で精度を低下させた。
  • 256×256の入力解像度が、大規模バッチ学習において最良の性能を示した。これは、解像度とDPの有効性の間に非自明な関係があることを示唆している。
  • 1エポック(1回のフルバッチステップに相当)の学習で、より長い訓練スケジュールを上回る性能を達成した。これは、ノイズの蓄積が減少し、プライバシー会計が改善されたためと推測される。
  • 大規模事前学習、LAMB最適化、最小限の微調整の組み合わせにより、Kurakinら(2022年)およびDeら(2022年)の先行研究を上回る最先端の結果が得られ、テストした全ε値において優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。