Skip to main content
QUICK REVIEW

[論文レビュー] A simple defense against adversarial attacks on heatmap explanations

Laura Rieger, Lars Kai Hansen|arXiv (Cornell University)|Jul 13, 2020
Adversarial Robustness in Machine Learning参考文献 34被引用数 8
ひとこと要約

本稿では、複数の説明手法(例:ガイドドバックプロパゲーション、LRP、サリエンシーマップ)の平均化により、ヒートマップ説明に対する adversarial 攻撃から防御するシンプルな防御法である AGG-Mean を提案する。攻撃者がモデル重みと説明手法を完全に把握している状況下でも、複数手法の多様性と平均化に起因する滑らかさを活用することで、AGG-Mean は攻撃下でも元の説明を著しく良好に保持する。個々の手法に比べて顕著に優れた性能を示す。

ABSTRACT

With machine learning models being used for more sensitive applications, we rely on interpretability methods to prove that no discriminating attributes were used for classification. A potential concern is the so-called "fair-washing" - manipulating a model such that the features used in reality are hidden and more innocuous features are shown to be important instead. In our work we present an effective defence against such adversarial attacks on neural networks. By a simple aggregation of multiple explanation methods, the network becomes robust against manipulation. This holds even when the attacker has exact knowledge of the model weights and the explanation methods used.

研究の動機と目的

  • 機械学習モデルにおける差別的特徴を隠すために攻撃者が説明を操作する「フェアウォッシュィング」の増加するリスクに対処すること。
  • 入力を目に見える範囲で変化させずにヒートマップを改ざんする説明手法に対する adversarial 攻撃を防御すること。
  • モデルアーキテクチャや重みの変更を必要としない、軽量で侵襲のない防御を構築すること。
  • 多様な説明手法を統合することで、adversarial な操作に対する堅牢性が向上するかを評価すること。

提案手法

  • 本防御は、複数の説明手法(例:ガイドドバックプロパゲーション、LRP、サリエンシーマップ)のヒートマップを単純な平均演算で統合する。
  • 本手法は推論時のみに適用され、下位のニューラルネットワークの再訓練や変更を必要としない。
  • 説明手法の多様性を活用することで滑らかさが誘発され、adversarial パーティクルの感度が低下する。
  • 攻撃者の強い仮定(モデル重み、説明手法の完全な知識、入力パラメータの制御)の下で評価される。
  • ImageNet を含む複数のアーキテクチャとデータセットで一般化を確認する。
  • 個々の説明手法や他の統合戦略と比較され、PCC、topK ユニオン、MSE といった指標が用いられる。

実験結果

リサーチクエスチョン

  • RQ1複数の説明手法を統合することで、ヒートマップ説明に対する adversarial 攻撃に対する堅牢性が向上するか?
  • RQ2攻撃者がモデル重みと説明手法を完全に把握している状況でも、統合された説明の堅牢性は維持されるか?
  • RQ3adversarial 攻撃の転送性は、異なる説明手法間でどのように変化するか?統合はこの転送性を低減するか?
  • RQ4統合された説明の堅牢性は、平均化に起因する滑らかさによるものであり、SmoothGrad よろしくらべてどうか?
  • RQ5単一の説明手法をアンサンブルに置き換えることで、異なる単一手法よりも強い防御が得られるか?

主な発見

  • AGG-Mean は、個々の説明手法すべてを著しく上回る堅牢性を示し、トップ10%ユニオンスコアは 0.24 であり、次に優れた手法(LRP)の 0.49 よりも顕著に高い。
  • AGG-Mean の PCC(ピアソン積率相関係数)は 0.54 であり、LRP(0.81)や GB(0.77)よりも顕著に低い。これは攻撃下でも元の説明構造が良好に保持されていることを示す。
  • AGG-Mean の MSE(平均二乗誤差)は -0.89 (*10e-9) であり、GB(-3.25)や LRP(-1.45)よりも顕著に低い。これは、AGG-Mean の adversarial 説明が元の分布に近いことを示している。
  • 攻撃の転送性は低い:例えば、ガイドドバックプロパゲーションをだますように作られた adversarial 例は、他の手法(例:LRP)に効果的に転送されない。図2の点がアイデンティティラインから逸れる様子から明らかである。
  • 攻撃者が使用される正確な説明手法と入力を制御している状況下でも、AGG-Mean は元の説明に高い忠実性を維持する。図4および図5で可視化されている。
  • 本防御は計算的に効率的であり、モデルの再訓練やアーキテクチャ変更を必要とせず、実世界への導入に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。