Skip to main content
QUICK REVIEW

[論文レビュー] Exploring the Relationship between Architecture and Adversarially Robust Generalization

Aishan Liu, Shiyu Tang|arXiv (Cornell University)|Sep 28, 2022
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本論文は、ニューラルネットワークアーキテクチャと敵対的に頑健な一般化の関係を調査し、Vision Transformers(例:PVT、CoAtNet)が、特定の攻撃に過適合しやすいCNNと比較して、複数の$ε$-ノルム攻撃においてより優れた一般化を示すことを発見した。著者らは、注目メカニズムにおける高い重みスパarsityが、ラデマッハ複雑度解析を通じて頑健性を向上させることを理論的に結びつけた。

ABSTRACT

Adversarial training has been demonstrated to be one of the most effective remedies for defending adversarial examples, yet it often suffers from the huge robustness generalization gap on unseen testing adversaries, deemed as the adversarially robust generalization problem. Despite the preliminary understandings devoted to adversarially robust generalization, little is known from the architectural perspective. To bridge the gap, this paper for the first time systematically investigated the relationship between adversarially robust generalization and architectural design. Inparticular, we comprehensively evaluated 20 most representative adversarially trained architectures on ImageNette and CIFAR-10 datasets towards multiple `p-norm adversarial attacks. Based on the extensive experiments, we found that, under aligned settings, Vision Transformers (e.g., PVT, CoAtNet) often yield better adversarially robust generalization while CNNs tend to overfit on specific attacks and fail to generalize on multiple adversaries. To better understand the nature behind it, we conduct theoretical analysis via the lens of Rademacher complexity. We revealed the fact that the higher weight sparsity contributes significantly towards the better adversarially robust generalization of Transformers, which can be often achieved by the specially-designed attention blocks. We hope our paper could help to better understand the mechanism for designing robust DNNs. Our model weights can be found at http://robust.art.

研究の動機と目的

  • アーキテクチャ設計が敵対的頑健な一般化に与える影響を、特に多様な$ε$-ノルム攻撃の文脈で体系的かつ調査すること。
  • 敵対的頑健性学習下でのより良い一般化に寄与するアーキテクチャ要因を同定すること。
  • 同じ訓練設定であっても、Vision Transformersが未知の攻撃者に対してなぜCNNよりも一般化性能に優れるのかを説明すること。
  • ラデマッハ複雑度を用いて、重みスパarsityが敵対的頑健な一般化に果たす役割を理論的に分析すること。

提案手法

  • ImageNetteおよびCIFAR-10で、複数の$ε$-ノルム攻撃($\ell_1$、$\ell_2$、$\ell_\infty$)の下で、20種類の敵対的訓練済みアーキテクチャ(ViT、PVT、ResNet、VGGなど)を包括的に評価。
  • アーキテクチャ間の公平な比較を保つために、すべてのモデルを統一されたハイパーパrameterで訓練。
  • 重みスパarsityとTransformerにおける頑健な一般化の向上を結びつけるために、ラデマッハ複雑度を用いた理論的分析。
  • CIFAR-10-CおよびImageNette-Cを用いて、敵対的例以外の一般化性能を評価するため、一般的な腐食下での一般化を評価。
  • パッチサイズおよびアーキテクチャ的要素(例:注目ブロック)のアブレーションスタディを実施し、それらが頑健性に与える影響を分離して分析。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練下で、複数の$ε$-ノルム攻撃者に対して、Vision TransformersはCNNよりも一般化性能が優れているか?
  • RQ2より良い敵対的頑健な一般化に寄与するアーキテクチャ的特性は何か?
  • RQ3重みスパarsityは敵対的頑健な一般化にどのように影響し、Transformerの優れた性能の鍵要因であるか?
  • RQ4なぜCNNは特定の攻撃に過適合しやすく、一方でTransformerは複数の攻撃タイプにわたって一般化性能に優れるのか?
  • RQ5ラデマッハ複雑度は、異なるアーキテクチャの頑健な一般化行動を理論的に説明できるか?

主な発見

  • PVT や CoAtNet などのVision Transformersは、複数の$ε$-ノルム攻撃において顕著に優れた最悪ケースの頑健な正確度を達成しており、例としてImageNetteにおけるPVTv2(パッチサイズ4)では33.54%の最悪ケース正確度を示した。
  • ResNet や VGG などのCNNは特定の攻撃に強く過適合し、ViTAEでは$\ell_1$攻撃下で最悪ケース正確度が21.10%まで低下した。
  • Transformerは一般的な腐食下でも優れた一般化を示した。例えば、CoAtNetはCIFAR-10-Cで79.91%の正確度を達成し、CIFAR-10のクリーン正確度81.20%、CIFAR-10-C正確度79.24%を示すResNetを上回った。
  • 理論的分析により、注目ブロックによって達成される高い重みスパarsityが、敵対的頑健な一般化を顕著に向上させることを明らかにした。これはラデマッハ複雑度の境界を用いて形式化された。
  • パッチサイズ1のPVTv2は、ImageNetteで94.60%のヴァナイル正確度、$\ell_\infty$-PGD攻撃下で54.59%の頑健な正確度を達成し、攻撃タイプにわたる強い頑健な一般化を示した。
  • ImageNetでは、Transformerのクリーン正確度と頑健な正確度のギャップがCNNよりも大きいことが判明し、アーキテクチャ設計が特定の頑健性と一般化のトレードオフに合わせて調整される必要があることを示唆した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。