Skip to main content
QUICK REVIEW

[論文レビュー] CAMERAS: Enhanced Resolution And Sanity preserving Class Activation Mapping for image saliency

Mohammad A. A. K. Jalwana, Naveed Akhtar|arXiv (Cornell University)|Jun 20, 2021
Adversarial Robustness in Machine Learning参考文献 35被引用数 6
ひとこと要約

CAMERASは、外部の事前知識を用いずに、マルチスケールの活性化マップと勾配を体系的に統合することで、解像度を向上させるとともにマップの整合性を保つ、バックプロパゲーションに基づく新規のサリエンシー手法を提案する。この手法は、指差しゲームのベンチマークで最大27.5%の誤差低減を達成し、モデルの解釈可能性と adversarial 攻撃の効率を向上させる高精度なサリエンシー地図を可能にする。

ABSTRACT

Backpropagation image saliency aims at explaining model predictions by estimating model-centric importance of individual pixels in the input. However, class-insensitivity of the earlier layers in a network only allows saliency computation with low resolution activation maps of the deeper layers, resulting in compromised image saliency. Remedifying this can lead to sanity failures. We propose CAMERAS, a technique to compute high-fidelity backpropagation saliency maps without requiring any external priors and preserving the map sanity. Our method systematically performs multi-scale accumulation and fusion of the activation maps and backpropagated gradients to compute precise saliency maps. From accurate image saliency to articulation of relative importance of input features for different models, and precise discrimination between model perception of visually similar objects, our high-resolution mapping offers multiple novel insights into the black-box deep visual models, which are presented in the paper. We also demonstrate the utility of our saliency maps in adversarial setup by drastically reducing the norm of attack signals by focusing them on the precise regions identified by our maps. Our method also inspires new evaluation metrics and a sanity check for this developing research direction. Code is available here https://github.com/VisMIL/CAMERAS

研究の動機と目的

  • 深層ネットワークのクラスに依存しない初期層による、バックプロパゲーションに基づく手法におけるサリエンシー地図の低解像度という限界を解消すること。
  • サリエンシー地図の整合性とモデルの忠実度を損なう外部事前知識やヒューリスティクスに依存しないこと。
  • 組み合わせ的な層選択を回避するため、単一のネットワーク層のみを用いて高精度・高解像度のサリエンシー地図を生成すること。
  • 深層学習の解釈性におけるサリエンシー手法のための新しい評価指標とピクセル単位の整合性チェックを提供すること。
  • 摂動を顕著な領域に集中させることで、ノルムを低減しつつも騙しの信頼度を維持するという観点から、adversarial 攻撃における実用性を示すこと。

提案手法

  • 単一のネットワーク層から得られるマルチスケールの活性化マップと逆伝播勾配を体系的に蓄積・統合し、高解像度のサリエンシー地図を生成する。
  • 統合されたマップにReLUおよびL2正規化を適用し、非負で正規化されたサリエンシー得点を保証する。
  • 補間や外部事前知識を用いずに、元の入力画像解像度に正規化されたサリエンシー地図を埋め込む。
  • 深層ネットワークの微分可能性を活用して勾配をエンドツーエンドで計算し、モデル中心の帰属割り当てを保持する。
  • PGD adversarial 攻撃フレームワークを、CAMERASのサリエンシーを用いて強化し、摂動を高重要度領域に限定する。
  • 層の重みをランダム化した際のサリエンシー地図とモデル予測への影響を評価することで、ピクセル単位の整合性チェックを実施する。

実験結果

リサーチクエスチョン

  • RQ1外部の事前知識やヒューリスティクスに依存せずに、深層視覚モデルに対して高解像度で整合性を保ったサリエンシー地図を生成できるか?
  • RQ2正確なサリエンシー地図は、深層ニューラルネットワークアーキテクチャ間の特徴注視の違いをどのように明らかにするか?
  • RQ3高忠実度のサリエンシー地図は、摂動ノルムを低減させることで、adversarial 攻撃の効率をどの程度向上できるか?
  • RQ4高精度なサリエンシー手法のための、新たな評価指標と整合性チェックは何か?
  • RQ5サリエンシー地図は、チェーンリンクフェンスやスイングなど視覚的に類似した物体の、モデル中心の識別をどのように明らかにするか?

主な発見

  • CAMERASは、指差しゲームの指標で最大27.5%の誤差低減を達成し、最先端のサリエンシー手法を著しく上回る。
  • 本手法により、モデル間の細粒度の特徴注視の違い(例:類似した物体におけるチェーンの結び目と大きな構造への注視の違い)を明確に可視化できるようになった。
  • PGDに統合した場合、CAMERASは平均摂動ノルムを56.5%低減しつつ、ImageNet上で99.99%の騙しの信頼度を維持した。
  • CAMERASで計算されたサリエンシー地図は、ピクセル単位の整合性チェックに合格しており、ネットワーク重みをランダム化するとサリエンシーが比例して劣化するため、マップの整合性が確認された。
  • 外部事前知識の欠如により、視覚的に類似したクラスに対して、以前は観測されていなかったモデル固有の特徴重要度の差を検出できるようになった。
  • CAMERASは、2つの新しい評価指標とピクセル単位の整合性チェックを導入し、深層学習における高忠実度サリエンシー評価の基準を前進させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。