Skip to main content
QUICK REVIEW

[論文レビュー] Concise Explanations of Neural Networks using Adversarial Training

Prasad Chalasani, Jiefeng Chen|arXiv (Cornell University)|Oct 15, 2018
Adversarial Robustness in Machine Learning参考文献 23被引用数 11
ひとこと要約

この論文は、ℓ∞-有界摂動を用いた adversarial training が、深層ニューラルネットワークにおける特徴帰属度をよりスパースかつ簡潔にすることで、精度を損なわずにモデルの説明可能性を向上させることを示している。理論的分析と実験的結果から、ℓ∞-adversarial training は Integrated Gradients や DeepSHAP の帰属度に自然にスパarsity を促進する(ℓ1-正則化を上回る)一方で、説明の安定性も向上させている。

ABSTRACT

We show new connections between adversarial learning and explainability for deep neural networks (DNNs). One form of explanation of the output of a neural network model in terms of its input features, is a vector of feature-attributions. Two desirable characteristics of an attribution-based explanation are: (1) $ extit{sparseness}$: the attributions of irrelevant or weakly relevant features should be negligible, thus resulting in $ extit{concise}$ explanations in terms of the significant features, and (2) $ extit{stability}$: it should not vary significantly within a small local neighborhood of the input. Our first contribution is a theoretical exploration of how these two properties (when using attributions based on Integrated Gradients, or IG) are related to adversarial training, for a class of 1-layer networks (which includes logistic regression models for binary and multi-class classification); for these networks we show that (a) adversarial training using an $\ell_\infty$-bounded adversary produces models with sparse attribution vectors, and (b) natural model-training while encouraging stable explanations (via an extra term in the loss function), is equivalent to adversarial training. Our second contribution is an empirical verification of phenomenon (a), which we show, somewhat surprisingly, occurs $ extit{not only}$ $ extit{in 1-layer networks}$, $ extit{but also DNNs}$ $ extit{trained on }$ $ extit{standard image datasets}$, and extends beyond IG-based attributions, to those based on DeepSHAP: adversarial training with $\ell_\infty$-bounded perturbations yields significantly sparser attribution vectors, with little degradation in performance on natural test data, compared to natural training. Moreover, the sparseness of the attribution vectors is significantly better than that achievable via $\ell_1$-regularized natural training.

研究の動機と目的

  • 高リスク分野での信頼性と解釈可能性を阻害する、深層ニューラルネットワークにおける簡潔で安定した説明の不足に対処すること。
  • 従来、耐性向上に用いられる adversarial training が、Integrated Gradients や DeepSHAP などの特徴帰属度手法のスパarsity と安定性を向上させるかどうかを調査すること。
  • 特に特徴帰属度のスパarsity の観点から、adversarial robustness と explainability の間の理論的・実験的関係を明らかにすること。
  • adversarial training が、最も関連性の高い入力特徴に焦点を当てることで、人間にとって使いやすい解釈可能なモデルを実現することを示すこと。
  • 自然学習における ℓ1-正則化と比較して、adversarial training がスパース帰属度を達成する効果性を検証すること。

提案手法

  • 凸損失関数を伴う 1 層のニューラルネットワーク(ロジスティック回帰を含む)に対して、ℓ∞-有界 adversarial training の下で重みの縮小条件を理論的に分析する。
  • 特徴重要度ベクトルをモデル入力に対して計算するために、Integrated Gradients (IG) と DeepSHAP を帰属度手法として使用する。
  • 各訓練例が半径 ε の ℓ∞-ボール内での最悪の δ によって摂動され、損失を最大化するように、adversarial training をロバスト最適化問題として定式化する。
  • 損失関数に説明の安定性と adversarial robustness を結びつける数学的に同等な安定性正則化項を導入する。
  • MNIST、Fashion-MNIST、CIFAR-10 データセットを用い、3 種類のモデル(自然学習、ℓ1-正則化、ℓ∞-adversarially trained)に対して、Gini 指数と視覚的サリエンシーマップを用いて帰属度のスパarsity を実験的に評価する。
  • 自然テストデータ上の予測信頼度を用いて、Gini 指数や予測信頼度といった指標を通じて、帰属度のスパarsity とモデルの精度を、さまざまなモデル間で比較する。

実験結果

リサーチクエスチョン

  • RQ1自然学習と比較して、ℓ∞-adversarial training は深層ニューラルネットワークにおける特徴帰属度ベクトルをよりスパースにするか?
  • RQ2adversarial training は、入力の局所的近傍における特徴帰属度の安定性を向上させるか?
  • RQ3ℓ∞-adversarial training が誘発するスパarsity は、自然学習における ℓ1-正則化によるものよりも優れているか?
  • RQ4adversarial training は、モデル性能の低下を伴わずに、説明の簡潔さをどの程度向上させるか?
  • RQ51 層ネットワークにおける adversarial training とスパarsity の理論的関係は、標準的なビジョンベンチマークにおけるより深い DNN へと拡張可能か?

主な発見

  • ℓ∞-adversarial training は、MNIST、Fashion-MNIST、CIFAR-10 データセットにおいて、Integrated Gradients や DeepSHAP の帰属度ベクトルのスパarsity を顕著に向上させる。
  • adversarially trained モデルは、自然学習および ℓ1-正則化モデルよりも高い Gini 指数(スパarsity の指標)を達成する。例:自然学習の MNIST では Gini 指数 0.9271 対して、adversarial MNIST では 0.9728。
  • adversarial training によるスパarsity の向上は、DeepSHAP において特に顕著であり、MNIST や Fashion-MNIST において Integrated Gradients よりも顕著に現れる。
  • adversarial training は自然データ上の高いテスト精度を維持しており、自然学習と比較して性能の低下が最小限に抑えられており、耐性と精度のトレードオフがないことを示している。
  • 理論的分析により、ℓ∞-adversarial training は弱い特徴の重みを自然学習よりも強く縮小するため、よりスパースな帰属度が得られることを確認した。
  • adversarial training は、入力周辺の局所的挙動を暗黙的に正則化することで、帰属度の安定性が本質的に向上することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。