Skip to main content
QUICK REVIEW

[論文レビュー] Scalable and Efficient Training of Large Convolutional Neural Networks with Differential Privacy

Zhiqi Bu, Jialin Mao|arXiv (Cornell University)|May 21, 2022
Privacy-Preserving Technologies in Data被引用数 8
ひとこと要約

本論文は、大規模な畳み込みニューラルネットワーク(CNN)およびビジョントランスフォーマー(ViT)の差分プライバシー(DP)学習における、1サンプルごとの勾配クリッピングを効率的に行うための新規で効率的な手法、ミックス・ゴーストクリッピングを紹介する。1サンプルごとの勾配を明示的に計算する必要を排除することで、メモリと計算のオーバーヘッドを削減し、非プライベート学習と比較して最大3倍速く、メモリコストは1–10%に抑えられる。CIFAR-10(ε=1のとき96.7%)およびCIFAR-100(ε=1のとき83.0%)で最先端の精度を達成した。

ABSTRACT

Large convolutional neural networks (CNN) can be difficult to train in the differentially private (DP) regime, since the optimization algorithms require a computationally expensive operation, known as the per-sample gradient clipping. We propose an efficient and scalable implementation of this clipping on convolutional layers, termed as the mixed ghost clipping, that significantly eases the private training in terms of both time and space complexities, without affecting the accuracy. The improvement in efficiency is rigorously studied through the first complexity analysis for the mixed ghost clipping and existing DP training algorithms. Extensive experiments on vision classification tasks, with large ResNet, VGG, and Vision Transformers, demonstrate that DP training with mixed ghost clipping adds $1\sim 10\%$ memory overhead and $<2 imes$ slowdown to the standard non-private training. Specifically, when training VGG19 on CIFAR10, the mixed ghost clipping is $3 imes$ faster than state-of-the-art Opacus library with $18 imes$ larger maximum batch size. To emphasize the significance of efficient DP training on convolutional layers, we achieve 96.7\% accuracy on CIFAR10 and 83.0\% on CIFAR100 at $ε=1$ using BEiT, while the previous best results are 94.8\% and 67.4\%, respectively. We open-source a privacy engine (\url{https://github.com/woodyx218/private_vision}) that implements DP training of CNN with a few lines of code.

研究の動機と目的

  • 大規模なCNNのDP学習における1サンプルごとの勾配クリッピングの高い計算コストとメモリコストを低減すること。
  • 特に高いモデル精度を達成するために必要な大きなバッチサイズを用いる場合に生じるDP学習のスケーラビリティのボトルネックを克服すること。
  • 強力なプライバシー保証のもとで、ResNet、VGG、ビジョントランスフォーマー(ViT)を含む大規模なビジョンモデルの効率的学習を可能にすること。
  • 効率的なクリッピングを用いることで、大規模なDPモデルが必ずしも小さなモデルより性能が劣るわけではないことを示し、従来の経験的観察に挑戦すること。
  • CNNおよびViTのビジョンモデルにおけるDP学習の導入を容易にする実用的でオープンソースのプライバシーエンジンを提供すること。

提案手法

  • 1サンプルごとの勾配を明示的に計算しないようにするため、ゴースト勾配とレイヤーワイズクリッピング意思決定のハイブリッドを活用する、ミックス・ゴーストクリッピングを提案。
  • 空間的次元(H×W)に基づいて、標準的クリッピングとゴーストクリッピングの間で選択するレイヤーワイズ意思決定原則を導入し、メモリオーバーヘッドを最小限に抑える。
  • 任意のDP最適化手法および任意のクリッピング関数と互換性を持たせ、非プライベート学習に近いメモリ効率を維持する。
  • 中間の1サンプルごとの勾配を保存せずに、勾配ノルムとクリッピング済み勾配を計算する計算グラフを設計し、メモリフットプリントを削減。
  • 特定の特徴マップのみをゴースト勾配技術で処理するミックス戦略を採用し、精度と効率のバランスを図る。
  • CNNおよびViTの即時的なDP学習を可能にするプライバシーエンジンに統合(https://github.com/woodyx218/private_vision でオープンソース化)。

実験結果

リサーチクエスチョン

  • RQ1大規模なCNNのDP学習における1サンプルごとの勾配クリッピングを、モデルの精度を損なわせることなく、大幅にメモリと時間のオーバーヘッドを低減できるか?
  • RQ2ミックス・ゴーストクリッピングの効率性により、VGG やビジョントランスフォーマー(ViT)といった大規模モデルを、強力なプライバシー保証(例:ε=1)のもとで学習可能となり、精度が向上するか?
  • RQ3ミックス・ゴーストクリッピングと、Opacus やゴーストクリッピングなどの既存のクリッピング手法との間で、理論的および経験的複雑度のトレードオフは何か?
  • RQ4大規模なDPビジョンモデルは、CIFAR-10 や CIFAR-100 といった標準ベンチマークで、特に強いプライバシー制約のもとでも最先端の性能を達成できるか?
  • RQ5ミックス・ゴーストクリッピングによるメモリ効率の向上により、どの程度大きなバッチサイズが可能になり、それが学習速度と収束にどのように影響するか?

主な発見

  • ミックス・ゴーストクリッピングは、303Mパラメータを持つBEiTのような大規模モデルですら、非プライベート学習と比較してメモリオーバーヘッドを10%未満、学習遅延を2倍未満に抑える。
  • CIFAR-10 におけるVGG19では、ミックス・ゴーストクリッピングはOpacusに比べ3倍速く、最大バッチサイズを18倍に拡大可能である。
  • ε=1のとき、BEiTを用いてCIFAR-10で96.7%のテスト精度、CIFAR-100で83.0%のテスト精度を達成し、それぞれ94.8%および67.4%の従来のSOTA結果を上回った。
  • この手法により、CrossViT や BEiT といったViTも、非プライベート学習と比較して0.3%の追加メモリで大規模に学習可能であり、非プライベート学習の2倍の速度で実行可能である。
  • 複雑度解析により、原理的なレイヤーワイズクリッピング戦略を用いることで、既存手法が負う高いメモリ負荷を回避していることが確認された。
  • 同じバッチサイズでは、ミックス・ゴーストクリッピングは次善のDPアルゴリズムよりも1.7倍速く、メモリの節約により大きなバッチサイズが可能になったことで、最大3倍の高速化が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。