Skip to main content
QUICK REVIEW

[論文レビュー] Does Interpretability of Neural Networks Imply Adversarial Robustness

Adam Noack, Isaac Ahern|arXiv (Cornell University)|Dec 7, 2019
Adversarial Robustness in Machine Learning参考文献 57被引用数 10
ひとこと要約

この論文は、解釈可能な勾配をもつ深層ニューラルネットワークの学習が、敵対的ロバストネスを向上させるかを調査する。解釈正則化(IR)を導入し、勾配を類似度マップと整合させるとともにその大きさを低減することで、より解釈可能な勾配を持つモデルは、ℓ₂およびℓ∞の敵対的攻撃に対して著しくロバストになることが示された。特にSmoothGradと組み合わせると顕著な向上が得られる。

ABSTRACT

Deep neural networks (DNNs) have had many successes, but suffer from two major issues: (1) a vulnerability to adversarial examples and (2) a tendency to elude human interpretation. Interestingly, recent empirical and theoretical evidence suggest these two seemingly disparate issues are actually connected. In particular, robust models tend to provide more interpretable gradients than non-robust models. However, whether this relationship works in the opposite direction remains obscure. With this paper, we seek empirical answers to the following question: can models acquire adversarial robustness when they are trained to have interpretable gradients? We introduce a theoretically inspired technique called \emph{Interpretation Regularization} (IR), which encourages a model's gradients to (1) match the direction of interpretable target salience maps and (2) have small magnitude. To assess model performance and tease apart factors that contribute to adversarial robustness, we conduct extensive experiments on MNIST and CIFAR-10 with both $\ell_2$ and $\ell_\infty$ attacks. We demonstrate that networks trained to have interpretable gradients are more robust to adversarial perturbations. Applying the network interpretation technique SmoothGrad \cite{smoothgrad} yields additional performance gains, especially in cross-norm attacks and under heavy perturbation. The results indicate that the interpretability of the model gradients is a crucial factor for adversarial robustness.

研究の動機と目的

  • 解釈可能な勾配の向上が、深層ニューラルネットワークにおける敵対的ロバストネスの向上に寄与するかを調査すること。
  • 解釈可能性とロバストネスが相関しているのではなく、因果関係にあるのかという未解決の問いに答えること。
  • 解釈可能な勾配を明示的に促進する新しい訓練手法を開発し、評価すること。
  • 他のロバストネス向上要因とは分離して、勾配の解釈可能性の寄与を特定すること。

提案手法

  • モデルの勾配が事前に定義された類似度マップと整合するよう促進する訓練目的として、解釈正則化(IR)を提案する。
  • IRを、モデルの勾配とターゲットの類似度マップとのコサイン類似度を最小化する損失項として定式化する。
  • 勾配の大きさを抑制する第二の正則化項を導入し、より滑らかな意思決定境界を促進する。
  • 標準的および敵対的訓練を用い、MNISTおよびCIFAR-10でIRあり・なしの両方でモデルを訓練する。
  • 後処理としてSmoothGradを適用し、勾配の説明を精緻化し、ロバストネスを向上させる。
  • ℓ₂およびℓ∞の攻撃、特にノルムが異なる攻撃や高ノイズ設定下でのロバストネスを評価する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークを、解釈可能な勾配を生成するように学習させることで、敵対的ロバストネスが向上するか?
  • RQ2勾配が類似度マップと整合することによって、ロバストネスにどの程度寄与するか?
  • RQ3正則化によって勾配の大きさを低減させることで、ロバストネスが向上するか?
  • RQ4IRとSmoothGradを組み合わせることで、多様な攻撃タイプに対してロバストネスがどのように向上するか?
  • RQ5ロバストネスの向上は解釈可能性に起因するのか、それとも他の要因が関与しているのか?

主な発見

  • 解釈正則化(IR)を用いて学習したモデルは、標準的および敵対的訓練のベースラインと比較して、ℓ₂およびℓ∞の両方の攻撃に対して顕著に高いロバスト正答率を示した。
  • IRとSmoothGradの組み合わせは、特にノルムが異なる攻撃や高ノイズ設定下で顕著なロバストネスの向上をもたらした。
  • IRを用いて学習したロバストモデルは、類似度マップとの整合性を測定したところ、より解釈可能な勾配を生成した。
  • IRを用いて学習したモデルでは、勾配の大きさが一貫して低減しており、これはより滑らかな意思決定境界を示唆している。
  • アブレーションスタディにより、ロバストネスの向上が勾配の解釈可能性に直接関連していることが示された。
  • IRは、標準的な敵対的訓練と補完的に機能する、新たな効果的なインダクティブバイアスを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。