[論文レビュー] Differentially private training of residual networks with scale normalisation
本稿では、残差ネットワークにおける残差ブロックの加算演算の直後に正規化層を追加するシンプルなアーキテクチャ的変更であるScaleNormを導入する。これにより、残差パスと畳み込みパスの活性化がスケールが異なるという現象(スケールミキシング)が軽減される。DP-SGDと最近の訓練手法の適応を組み合わせることで、ε=8.0の条件下でCIFAR-10で82.5%のトップ1精度を達成し、スクラッチからの学習で新たなSOTAを樹立した。
The training of neural networks with Differentially Private Stochastic Gradient Descent offers formal Differential Privacy guarantees but introduces accuracy trade-offs. In this work, we propose to alleviate these trade-offs in residual networks with Group Normalisation through a simple architectural modification termed ScaleNorm by which an additional normalisation layer is introduced after the residual block's addition operation. Our method allows us to further improve on the recently reported state-of-the art on CIFAR-10, achieving a top-1 accuracy of 82.5% (ε=8.0) when trained from scratch.
研究の動機と目的
- 深層ニューラルネットワークの微分プライバシー訓練におけるプライバシーと性能のトレードオフを、医療やビジョン分野で高い精度と強いプライバシーを要する応用を念頭に、解決すること。
- DP-SGD訓練における残差ネットワークにおける「スケールミキシング」問題を調査・解消すること。これは、残差パスの活性化は正規化されていない一方で、特徴パスの活性化は正規化されているという現象である。
- DP-SGDを用いてスクラッチから訓練するResNetsの収束性とテスト精度を、最小限のアーキテクチャ的変更によって向上させること。
- ScaleNormを既存の訓練手法と組み合わせることで、微分プライバシー下での画像ベンチマークでSOTA性能を達成できることを示すこと。
提案手法
- ScaleNormの提案:残差ブロックにおける残差接続の加算演算の直後に挿入する追加の正規化層。
- 微分プライバシーの保証を維持するため、バッチ正規化がDP-SGDと互換性がないため、残差パスに対してグループ正規化を適用する。
- 標準的なResNetおよびWideResNetアーキテクチャにScaleNormを統合し、順伝搬を変更して、残差パスと特徴パスの和を正規化する。
- 微分プライバシー確率的勾配降下法(DP-SGD)を用いてモデルを訓練し、プライバシー会計にはRényi DP会計(Opacus)を適用する。
- Deら(2022年)の最近の訓練手法適応(増幅多重性、重み平均化など)を適用して、さらなる性能向上を図る。
- 最適化パラメータ探索にはOptunaを用い、木構造パルゼン推定器としきい値プルーニングを用い、各実行でプライバシー予算をリセットする。
実験結果
リサーチクエスチョン
- RQ1残差ネットワークにおけるスケールミキシングが、DP-SGD下での訓練収束性とテスト精度に与える影響は何か?
- RQ2ScaleNormのようなシンプルなアーキテクチャ的変更が、スケールミキシングを効果的に緩和し、微分プライバシー訓練におけるモデル性能を向上させられるか?
- RQ3高度な訓練技術と組み合わせた場合、ScaleNormがDP-SGDにおける精度向上にどの程度寄与するか?
- RQ4ScaleNormは、CIFAR-10、ImageNette、Tiny ImageNetなど、異なるアーキテクチャとデータセットに一般化可能か?
- RQ5高計算量の訓練適応を適用した場合、ScaleNormの導入による精度向上と訓練効率のトレードオフはどのようなものか?
主な発見
- スクラッチからの学習で、CIFAR-10においてε=8.0の条件下で82.5%のトップ1精度をScaleNormが達成し、新たなSOTAを樹立した。
- CIFAR-10では、同じプライバシー予算下で標準的なWRN-16/4(81.25%対82.5%)よりも1.25パーセンテージポイントの精度向上を達成した。
- ImageNetteでは、ε=9.88の条件下でトップ1精度が1.3パーセンテージポイント向上(67.1%対65.0%)した。
- Tiny ImageNetでは、ε=70の条件下で25.8%のトップ1精度を達成し、ベースラインより1.1パーセンテージポイント優れていた。
- テストした全プライバシーレベルにおいて一貫した向上が見られ、特に高いプライバシー予算での相対的向上率が最大であった。
- ScaleNormと完全な訓練適応を組み合わせた場合、訓練時間は約16時間(デュアルGPU)に増加したが、ベースラインモデルに比べて10%の精度向上が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。