Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Adversarial Training to Robustify Deep Neural Networks at Scale

Gaoyuan Zhang, Songtao Lu|arXiv (Cornell University)|Jun 13, 2022
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本稿では、複数のマシンに跨る大バッチの adversarial training をスケーラブルかつ汎用的に実行するための、Distributed Adversarial Training (DAT) というフレームワークを提案する。非凸設定下でも、収束速度 $O(1/\sqrt{T})$ で一次の停留点に収束し、ImageNet におけるロバスト精度を維持するとともに、勾配圧縮および半教師あり学習を効率的に行える。

ABSTRACT

Current deep neural networks (DNNs) are vulnerable to adversarial attacks, where adversarial perturbations to the inputs can change or manipulate classification. To defend against such attacks, an effective and popular approach, known as adversarial training (AT), has been shown to mitigate the negative impact of adversarial attacks by virtue of a min-max robust training method. While effective, it remains unclear whether it can successfully be adapted to the distributed learning context. The power of distributed optimization over multiple machines enables us to scale up robust training over large models and datasets. Spurred by that, we propose distributed adversarial training (DAT), a large-batch adversarial training framework implemented over multiple machines. We show that DAT is general, which supports training over labeled and unlabeled data, multiple types of attack generation methods, and gradient compression operations favored for distributed optimization. Theoretically, we provide, under standard conditions in the optimization theory, the convergence rate of DAT to the first-order stationary points in general non-convex settings. Empirically, we demonstrate that DAT either matches or outperforms state-of-the-art robust accuracies and achieves a graceful training speedup (e.g., on ResNet-50 under ImageNet). Codes are available at https://github.com/dat-2022/dat.

研究の動機と目的

  • 大規模ディープラーニングにおける adversarial training (AT) のスケーラビリティの限界を解消する。計算コストとデータサイズの高さが主な要因である。
  • データや計算リソースが複数のマシンに分散配置されている分散環境において、効果的な adversarial training を可能にする。
  • 分散環境において、教師あり、半教師あり、勾配圧縮のバリエーションを含む、AT の一般化フレームワークを構築する。
  • 標準的な非凸最適化条件下で、DAT の収束保証を理論的に確立する。
  • 実験的に、ImageNet、ランダムスムージング、ラベルなしデータ、さまざまなハードウェア構成という多様な設定において、DAT のロバスト性と効率性を検証する。

提案手法

  • 大バッチ更新を用いて、複数のマシンに跨る adversarial training をスケーリングする分散型のミニマックス最適化フレームワークを設計する。
  • 通信オーバーヘッドを低減するため、勾配圧縮および適応的学習率(例:LAMB 最適化法)を統合する。
  • PGD や FGSM などの複数の攻撃生成手法と、ラベルあり・なしのデータタイプを統合したパイプラインで一貫して扱えるようにアルゴリズムを定式化する。
  • 勾配推定誤差、量子化、適応的学習率、および内部最大化オракルからの誤差を理論的に分析する。
  • 一般非凸設定下で、一次の停留点への収束速度が $O(1/\sqrt{T})$ であることを導出する。
  • NCCL 通信バックエンドを実装し、InfiniBand および NVLink 通信インターコネクトを備えた HPC クラスタをサポートする。

実験結果

リサーチクエスチョン

  • RQ1分散コンピューティングを用いて、ロバスト性を損なわずに大バッチ設定での adversarial training を効果的にスケーリングできるか?
  • RQ2勾配圧縮や適応的学習率といった分散最適化コンponents が、adversarial training における収束性とロバスト精度に与える影響は何か?
  • RQ3非凸的・確率的・分散的設定下で、分散 adversarial training の理論的収束速度は何か?
  • RQ4ラベルあり/なしの混合データタイプを含む大規模データセット(例:ImageNet)で学習する際、提案フレームワークはロバストな性能を維持できるか?
  • RQ5標準クラスタとハイパフォーマンスコンピューティング(HPC)システムを含む、さまざまなハードウェア構成でも、フレームワークの性能は良好か?

主な発見

  • DAT は、ResNet-50 を用いた ImageNet において、大バッチでも最先端の手法と同等またはそれを上回るロバスト精度を達成した。
  • 従来の分散 AT で見られる性能劣化を回避しながら、高い標準精度を維持した。
  • 理論的分析により、非凸設定下で一次の停留点への収束速度が $O(1/\sqrt{T})$ であることが確認され、標準的な SGD と同等の性能を示した。
  • 実験結果から、計算ノード数の増加に伴い、トレーニング時間に滑らかなスケールアップが見られ、精度の低下も最小限に抑えられた(1, 3, 6 ノードでテスト)。
  • DAT は半教師ありのロバスト学習およびロバストな事前学習・微調整をサポートし、多様な学習パラダイムにわたる一般化能力を示した。
  • InfiniBand および NVLink を備えた HPC クラスタでは、通信コストが低減され、標準的な分散システムに比べてスケーラビリティが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。