Skip to main content
QUICK REVIEW

[論文レビュー] Towards Practical Lottery Ticket Hypothesis for Adversarial Training

Bai Li, Shiqi Wang|arXiv (Cornell University)|Mar 6, 2020
Adversarial Robustness in Machine Learning参考文献 34被引用数 9
ひとこと要約

本稿では、敵対的訓練中に標準的なロットリート・チケットよりも著しく高速に収束する、剪定された部分ネットワークである「ブースティングチケット」を導入している。著者らは、学習率、剪定比、モデル容量といったハイパーパramータの慎重なチューニングにより、この部分ネットワークを同定することで、WideResNet-34-10を用いたCIFAR-10上での敵対的訓練時間を最大49%短縮し、最先端のロバスト性を達成した。

ABSTRACT

Recent research has proposed the lottery ticket hypothesis, suggesting that for a deep neural network, there exist trainable sub-networks performing equally or better than the original model with commensurate training steps. While this discovery is insightful, finding proper sub-networks requires iterative training and pruning. The high cost incurred limits the applications of the lottery ticket hypothesis. We show there exists a subset of the aforementioned sub-networks that converge significantly faster during the training process and thus can mitigate the cost issue. We conduct extensive experiments to show such sub-networks consistently exist across various model structures for a restrictive setting of hyperparameters ($e.g.$, carefully selected learning rate, pruning ratio, and model capacity). As a practical application of our findings, we demonstrate that such sub-networks can help in cutting down the total time of adversarial training, a standard approach to improve robustness, by up to 49\% on CIFAR-10 to achieve the state-of-the-art robustness.

研究の動機と目的

  • 敵対的訓練中に標準的なロットリート・チケットよりも著しく高速に収束する部分ネットワークを同定すること。
  • 剪定された部分ネットワーク(ブースティングチケット)における高速収束を可能にするハイパーパramータを調査すること。
  • 弱いロバスト性を持つモデルを剪定することで、強力な敵対的訓練を高速化するブースティングチケットを生成できることを示すこと。
  • ロバスト性を損なわずに敵対的訓練の総合訓練コストを削減すること。

提案手法

  • 学習率、剪定比、モデル容量の影響を系統的に評価し、ブースティングチケットの性能に与える影響を分析する。
  • 弱いロバスト性を持つモデルに対してFGSMベースの敵対的訓練を適用し、剪定マスクを生成した後、剪定された部分ネットワークを再訓練して強力なロバスト性を達成する。
  • 2段階のプロセスを用いる:まず弱いロバスト性を持つモデルを訓練し、その後それを剪定してブースティングチケットを同定し、強力な敵対的訓練における高速収束を実現する。
  • WideResNet-34-10上で、標準的な敵対的訓練とブースティングチケットベースのアプローチの間で、訓練時間とロバスト精度を比較する。
  • VGG-16、ResNet-18、WideResNetアーキテクチャを対象に広範なアブレーションスタディを実施し、一般化性を検証する。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練中に、標準的なロットリート・チケットよりも著しく高速に収束する部分ネットワークが存在するか?
  • RQ2学習率、剪定比、モデル容量のうち、どのハイパーパラメータがブースティング効果に最も強く影響を与えるか?
  • RQ3弱いロバスト性を持つモデルから得たブースティングチケットは、強力なロバストモデルの訓練を高速化できるか?
  • RQ4敵対的訓練の設定下でもブースティングチケット現象は継続するか?

主な発見

  • CIFAR-10でWideResNet-34-10を用いた場合、ブースティングチケットは敵対的訓練の総合時間を最大49%短縮し、最先端のロバスト精度を達成した。
  • パラメータの80%を剪定したWideResNet-34-10では、ブースティングチケットはわずか1回のエポックで90.88%のテスト精度に到達し、30エポック以上を要するモデルと同等の性能を示した。
  • ブースティング効果は学習率、剪定比、ネットワーク容量に最も敏感であり、最適な設定により急速な収束が実現された。
  • ブースティングチケットは敵対的訓練スキームに存在し、弱いロバスト性を持つモデルを剪定することで同定可能であり、強力なロバストモデルの訓練を高速化できる。
  • 標準的なMadry et al.の敵対的訓練よりも高いロバスト精度を達成するとともに、総合訓練時間を49%削減した。
  • トランスファー攻撃の結果、ブースティングチケットで訓練されたモデルとMadry et al.の手法で訓練されたモデルの間で、共通の意思決定境界が観察された。これは、ロバスト性の整合性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。