Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Visual Robustness by Causal Intervention

Kaihua Tang, Mingyuan Tao|arXiv (Cornell University)|Jun 17, 2021
Adversarial Robustness in Machine Learning参考文献 83被引用数 8
ひとこと要約

本稿では、視錘走性サンプリングと空間内挿による線形応答を促すことで、因果的特徴を学習するようモデルを正則化する、因果的干渉による道具変数法(CiiV)を提案する。CiiVは、CIFAR-10、CIFAR-100、mini-ImageNetでAdaptive攻撃(例:AutoAttack)に対して最先端の耐性を達成しており、敵対的訓練例を必要としない。

ABSTRACT

Adversarial training is the de facto most promising defense against adversarial examples. Yet, its passive nature inevitably prevents it from being immune to unknown attackers. To achieve a proactive defense, we need a more fundamental understanding of adversarial examples, beyond the popular bounded threat model. In this paper, we provide a causal viewpoint of adversarial vulnerability: the cause is the spurious correlation ubiquitously existing in learning, i.e., the confounding effect, where attackers are precisely exploiting these effects. Therefore, a fundamental solution for adversarial robustness is by causal intervention. As these visual confounders are imperceptible in general, we propose to use the instrumental variable that achieves causal intervention without the need for confounder observation. We term our robust training method as Causal intervention by instrumental Variable (CiiV). It's a causal regularization that 1) augments the image with multiple retinotopic centers and 2) encourages the model to learn causal features, rather than local confounding patterns, by favoring features linearly responding to spatial interpolations. Extensive experiments on a wide spectrum of attackers and settings applied in CIFAR-10, CIFAR-100, and mini-ImageNet demonstrate that CiiV is robust to adaptive attacks, including the recent AutoAttack. Besides, as a general causal regularization, it can be easily plugged into other methods to further boost the robustness.

研究の動機と目的

  • 敵対的訓練の根本的限界(被動的かつ既知の攻撃者に過適合する)を是正するため、敵対的脆弱性の根本的原因を特定すること。
  • 深層ニューラルネットワークが微細な摂動に脆弱であるのに対し、人間の視覚は生物学的により複雑であるにもかかわらずそれらに頑健でない理由を解明すること。
  • 敵対的例がモデルの欠険ではなく、誤った相関(交絡要因)に起因するという因果的説明を提供すること。
  • 敵対的例を訓練中に必要としない、能動的防御メカニズムを開発することにより、未知および適応的攻撃に対しても耐性を発揮すること。
  • 道具変数を用いた因果的干渉が、多様なモデルやデータセットにおいて一般化可能な正則化手法として機能できることを実証すること。

提案手法

  • 視錘走性サンプリングに基づく道具変数フレームワークを導入し、網膜サンプリング位置(R)を交絡要因とは独立した道具として用いる。
  • 複数の視錘走性サンプリングマスク(N_R)を用いて入力画像を拡張し、人間視覚の非一様な視覚的注意に類似した挙動を再現する。
  • 空間的内挿における特徴の線形応答を促す正則化損失を実装し、局所的交絡要因に対する耐性を高める。
  • 線形応答制約を用いて、敵対的攻撃で悪用される局所的で見えない交絡パターン(例:小さなエッジ、テクスチャ)への依存を抑制する。
  • 交絡要因の直接観測を必要としない因果的干渉メカニズムを設計し、真の交絡要因が入手不能であっても耐性を発揮可能にする。
  • CiiVを既存モデルに即座に統合可能な正則化として組み込み、再訓練なしに耐性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1境界付きの脅威モデルを超えた敵対的脆弱性の根本的原因は何か?そしてそれを因果的に説明できるか?
  • RQ2なぜ深層ニューラルネットワークは容易に摂動を受けやすい非頑健な誤った特徴に依存するのか?一方、人間の視覚はそれらを避けるのか?
  • RQ3道具変数に基づく因果的干渉を用いて、訓練中に敵対的例を必要とせずにモデルを正則化できるか?
  • RQ4空間的内挿に対する線形応答を強制することで、適応的かつ未知の攻撃への一般化性能が向上するか?
  • RQ5CiiVは多様なモデルやデータセットにおいて一般化可能な正則化として使用可能か?

主な発見

  • CiiVは、CIFAR-100においてAutoAttack(l∞)で23.05%の頑健な正確度を達成し、標準的な敵対的訓練ベースラインを上回り、適応的攻撃への強力な一般化性能を示した。
  • CIFAR-10では、CiiVは58.88%のクリーン正確度とFGSM攻撃下で32.48%の頑健な正確度を達成し、クリーン性能と頑健性能の良好なトレードオフを実現した。
  • アブレーションスタディにより、視錘走性サンプリングマスクの数(N_R)を増やすことで耐性が向上することが確認され、N_R=5のときCIFAR-100で全体の頑健な正確度が37.98%に達した。
  • CiiVは局所的交絡要因への依存を顕著に低減した:可視化結果から、CiiVモデルを欺くには構造的パターンを消去する必要があることが示され、因果的特徴の学習が確認された。
  • CiiVはl∞およびl2バージョンのAutoAttackの両方で強力な性能を維持し、CIFAR-100ではそれぞれ22.61%および54.58%の全体的頑健な正確度を達成した。これにより、脅威モデルを超えた耐性が確認された。
  • CiiVはRetiAugなどの他の防御手法ともシームレスに統合可能であり、さらに耐性を向上させた。これにより、汎用正則化手法としてのプラグアンドプレイな潜在的価値が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。