Skip to main content
QUICK REVIEW

[論文レビュー] MixTrain: Scalable Training of Verifiably Robust Neural Networks

Shiqi Wang, Yizheng Chen|arXiv (Cornell University)|Nov 6, 2018
Adversarial Robustness in Machine Learning被引用数 10
ひとこと要約

MixTrainは、2つの革新的な手法—stochastic robust approximationとdynamic mixed training—を導入することで、$L_\infty$-有界攻撃に対して95.2%の検証可能で頑健な正確性を達成しながら、検証可能で頑健なニューラルネットワーク学習を最大15倍高速化する。この手法により、ImageNet-200で学習されたような大規模モデルに対してもスケーラブルかつ検証可能な頑健性が実現可能となり、速度、正確性、頑健性の面で、従来の敵対的および検証可能で頑健な学習法を上回る性能を発揮する。

ABSTRACT

Making neural networks robust against adversarial inputs has resulted in an arms race between new defenses and attacks. The most promising defenses, adversarially robust training and verifiably robust training, have limitations that restrict their practical applications. The adversarially robust training only makes the networks robust against a subclass of attackers and we reveal such weaknesses by developing a new attack based on interval gradients. By contrast, verifiably robust training provides protection against any L-p norm-bounded attacker but incurs orders of magnitude more computational and memory overhead than adversarially robust training. We propose two novel techniques, stochastic robust approximation and dynamic mixed training, to drastically improve the efficiency of verifiably robust training without sacrificing verified robustness. We leverage two critical insights: (1) instead of over the entire training set, sound over-approximations over randomly subsampled training data points are sufficient for efficiently guiding the robust training process; and (2) We observe that the test accuracy and verifiable robustness often conflict after certain training epochs. Therefore, we use a dynamic loss function to adaptively balance them for each epoch. We designed and implemented our techniques as part of MixTrain and evaluated it on six networks trained on three popular datasets including MNIST, CIFAR, and ImageNet-200. Our evaluations show that MixTrain can achieve up to $95.2\%$ verified robust accuracy against $L_\infty$ norm-bounded attackers while taking $15$ and $3$ times less training time than state-of-the-art verifiably robust training and adversarially robust training schemes, respectively. Furthermore, MixTrain easily scales to larger networks like the one trained on ImageNet-200, significantly outperforming the existing verifiably robust training methods.

研究の動機と目的

  • 検証可能で頑健な学習の計算コストとメモリ使用量の高さが、小規模なネットワークに限定されるのを是正する。
  • テスト正確性と検証可能で頑健な性能の両立に課題が生じるのを回避し、両者のトレードオフを動的にバランスさせる。
  • ImageNet-200のような大規模モデルに対しても、スケーラブルかつ検証可能な頑健な学習を可能にする。これは、従来の手法では処理できなかった。
  • 敵対的頑健性を持つネットワークが、例えばinterval gradient攻撃のような新たな攻撃に対して根本的に脆弱であることを示し、検証可能な防御の必要性を裏付ける。
  • 既存の頑健な学習法と比較して、大幅に訓練時間とメモリ使用量を削減しながら、最先端の検証可能で頑健な正確性を達成する。

提案手法

  • Stochastic robust approximationは、各エポック中に全データセットではなくランダムにサブサンプルされたミニバッチ上でのみ、頑健性違反の音声的上界近似を計算することで、学習コストを削減する。
  • Dynamic mixed trainingは、学習可能なハイパーパrameter $\alpha$ を用いて、標準的な交差エントロピー損失と頑健性損失を動的にバランスさせる適応的損失関数を採用する。$\alpha$ は各エポックごとに更新され、テスト正確性と検証可能で頑健な正確性のトレードオフを最適化する。
  • この手法は、全データセットにおける上界近似は最終的な頑健性検証にのみ必要であり、学習中の勾配ベース最適化には不要であるという洞察を活用している。
  • 適応的 $\alpha$ 機構により、学習が進むにつれて損失重みを動的に調整し、固定重み法が抱える正確性-頑健性トレードオフを回避する。
  • このフレームワークは MixTrain として実装され、MNIST、CIFAR、ImageNet-200 の6つのネットワークで評価された。$L_\infty$-ノルム有界攻撃を用いて検証された。
  • 敵対的頑健な学習の限界を露呈するため、新しい1次近似のinterval gradient攻撃が提案された。

実験結果

リサーチクエスチョン

  • RQ1ImageNet-200で学習されたような大規模ニューラルネットワークに、計算コストが著しく高騰しない範囲で検証可能で頑健な学習をスケーリングできるか?
  • RQ2ミニバッチ上でのみ上界近似を適用するstochastic robust approximationは、頑健な学習プロセスを十分に導くのに十分な正確性を維持できるか?
  • RQ3適応的 $\alpha$ を用いた動的損失重み付けは、固定重み学習と比較して、テスト正確性と検証可能で頑健な正確性のバランスを改善できるか?
  • RQ4MixTrainは、最先端の敵対的頑健および検証可能で頑健な学習法と比較して、性能と効率性で優れているか?
  • RQ5現在実装されている敵対的頑健なネットワークは、敵対的防御を回避する新たな攻撃、例えばinterval gradient攻撃に対してどの程度脆弱であるか?

主な発見

  • MixTrainは、CIFAR-10で$L_\infty$-ノルム有界攻撃に対して最大95.2%の検証可能で頑健な正確性を達成し、従来の検証可能で頑健な学習法を大きく上回った。
  • MixTrainは、最先端の検証可能で頑健な学習法と比較して最大15倍、敵対的頑健な学習法と比較して最大3倍の訓練時間を短縮したが、テスト正確性を維持または向上させた。
  • 既存の検証可能で頑健な学習法と比較して、最大50倍のメモリ使用量削減を達成し、ImageNet-200の大きなモデルの学習を可能にした。
  • 適応的 $\alpha$ の損失重み付けにより、固定 $\alpha=0.5$ と比較して、検証可能で頑健な正確性が6.7%(30.9%から37.6%)向上し、テスト正確性も1.3%(71.4%から71.7%)向上した。
  • 提案されたinterval gradient攻撃により、最先端の敵対的頑健なネットワークに対する攻撃成功確率が最大40%上昇し、それらの根本的な脆弱性が露呈された。
  • MixTrainは、従来の最先端の検証可能で頑健な学習法と比較して13.2%高いテスト正確性を達成した。これは、改善された学習ダイナミクスが正確性と頑健性の両方を向上させられることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。