Skip to main content
QUICK REVIEW

[論文レビュー] On the Efficacy of Differentially Private Few-shot Image Classification

Marlon Tobaben, Aliaksandra Shysheya|arXiv (Cornell University)|Feb 2, 2023
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本稿は、微分プライバシー(DP)を用いた少数-shot 画像分類を調査し、クラスあたりのショット数、プライバシー水準、モデルアーキテクチャ、パラメータ効率の良い微調整戦略を変化させた DP-SGD の包括的評価を提案する。FiLMアダプタが完全微調整と同等のDP性能を達成するとともに通信効率を向上させ、VTAB-1kベンチマークにおいてDP下でSOTAの正解率(51.9%のマクロF1)を達成したことが示された。

ABSTRACT

There has been significant recent progress in training differentially private (DP) models which achieve accuracy that approaches the best non-private models. These DP models are typically pretrained on large public datasets and then fine-tuned on private downstream datasets that are relatively large and similar in distribution to the pretraining data. However, in many applications including personalization and federated learning, it is crucial to perform well (i) in the few-shot setting, as obtaining large amounts of labeled data may be problematic; and (ii) on datasets from a wide variety of domains for use in various specialist settings. To understand under which conditions few-shot DP can be effective, we perform an exhaustive set of experiments that reveals how the accuracy and vulnerability to attack of few-shot DP image classification models are affected as the number of shots per class, privacy level, model architecture, downstream dataset, and subset of learnable parameters in the model vary. We show that to achieve DP accuracy on par with non-private models, the shots per class must be increased as the privacy level increases. We also show that learning parameter-efficient FiLM adapters under DP is competitive with learning just the final classifier layer or learning all of the network parameters. Finally, we evaluate DP federated learning systems and establish state-of-the-art performance on the challenging FLAIR benchmark.

研究の動機と目的

  • 微分プライバシー(DP)を用いた少数-shot 画像分類が、低データおよびドメイン外設定においてどのような条件下で有効であるかを調査すること。
  • DP微調整におけるプライバシー水準(ε)、クラスあたりのショット数、およびモデル正解率の間のトレードオフを評価すること。
  • 少数-shot 環境下におけるパラメータ効率の良い微調整手法(例:FiLMアダプタ、最終層のみ、完全微調整)の有効性をDP下で評価すること。
  • 結果をフェデレーテッドラーニングに拡張し、挑戦的な FLAIR ベンチマークにおけるDP性能を評価すること。
  • 少数-shot 環境下におけるDP-SGDのプライバシー会計手法(RDPとPRV)の系統的比較を提供すること。

提案手法

  • RDPおよびPRV会計法を用いたプライバシー会計により、(ε,δ)-微分プライバシー下で勾配クリッピングとノイズ注入を伴うDP-SGDを用いてモデルを訓練する。
  • ショット数(1~500)、プライバシー予算(ε ∈ {1,2,4,8})、下流データセット(CIFAR-10, CIFAR-100, SVHN, VTAB-1k)、モデルアーキテクチャ(ResNet, ViT)を変化させた広範なアブレーションスタディを実施する。
  • 3つの微調整戦略を評価:(1) 最終分類器層のみ、(2) すべてのモデルパラメータ、(3) 中間層に適用するパラメータ効率の良いFiLMアダプタ。
  • クライアントおよびサーバーの学習率、適応的クリッピング閾値をハイパーパramータサーチを用いて最適化し、中央集権的およびフェデレーテッドラーニング設定の両方で同じトレーニングプロトコルを適用する。
  • VTAB-1kベンチマークを用いて、ドメイン外転送性能とフェデレーテッドDPラーニングにおける通信効率を評価する。
  • δ(例:δ = 1e−5)を変化させた場合のε推定値の正確性と頑健性を確保するため、RDPおよびPRV会計法の両方を用いてプライバシー保証を再計算する。
Figure 1 : Classification accuracy as a function of shots and $\epsilon$ for CIFAR-10, CIFAR-100 and SVHN. Backbone is VIT-B and the best performing configuration out of All , FiLM and Head is used for each combination of $\epsilon$ and $S$ , with $\delta=1/|\mathcal{D}|$ . The accuracy is reported
Figure 1 : Classification accuracy as a function of shots and $\epsilon$ for CIFAR-10, CIFAR-100 and SVHN. Backbone is VIT-B and the best performing configuration out of All , FiLM and Head is used for each combination of $\epsilon$ and $S$ , with $\delta=1/|\mathcal{D}|$ . The accuracy is reported

実験結果

リサーチクエスチョン

  • RQ1クラスあたりのショット数が、プライバシー予算(ε)を変化させた場合の微分プライバシー少数-shot 画像分類の正解率に与える影響はいかほどか?
  • RQ2最終層、完全ネットワーク、FiLMアダプタのいずれかを用いた微調整戦略の選択が、少数-shot 環境下におけるDP正解率および通信効率に与える影響は?
  • RQ3ドメイン外転送(例:ImageNetからVTAB-1k)は、DPモデル性能をどの程度低下させるか。また、その影響を軽減する方法はあるか?
  • RQ4中央集権的DPトレーニングで観察されたトレンドは、特にプライバシー-正解率トレードオフの観点から、フェデレーテッドDPラーニングに一般化可能か?
  • RQ5異なるプライバシー会計法(RDP対PRV)は、計算されたε値にどのような影響を与え、実験間での比較可能性にどう影響するか?

主な発見

  • 非プライベートモデルの正解率に一致させるためには、プライバシー予算(ε)が低下するにつれて、クラスあたりのショット数を著しく増加させる必要がある。これは明確なデータ-プライバシーのトレードオフを示している。
  • 最終分類器層に加えてFiLMアダプタを微調整することで、VTAB-1kベンチマークにおいてDP下でSOTAの正解率(51.9%のマクロF1)を達成した。これは前回のSOTA(44.3%)に対して顕著な向上である。
  • 特にショット数が少ない場合やドメイン外設定下では、FiLMアダプタ微調整が完全微調整および最終層のみ微調整を上回り、正解率および通信効率の両面で優れた性能を示した。
  • DPモデルの正解率は、転送学習タスクの難易度と強く相関しており、より複雑またはドメイン外のデータセットでは、性能を維持するためにはより多くのデータまたはより優れたパラメータ化が必要となる。
  • PRV会計法を用いたプライバシー会計は、RDPに比べてわずかに低いε推定値をもたらし、プライバシー保証を強化しながらも、モデル性能は同等を維持した。
  • フェデレーテッドラーニングでは、提案されたDP-FedAvg設定がFLAIRベンチマークでSOTA性能を達成し、限られたデータ量のクライアントが存在する現実世界の分散環境においてもDPの実現可能性を示した。
On the Efficacy of Differentially Private Few-shot Image Classification

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。