[論文レビュー] NormGrad: Finding the Pixels that Matter for Training
この論文では、バックプロパゲーション中に局所的勾配重み積のフロベニウスノルムを計算することにより、深層ニューラルネットワークの学習において最も影響力を持つ画素を特定する、新しい手法NormGradを紹介する。1×1インジケータ畳み込みのテクニックを用いることで、任意のネットワーク層で高解像度のクラスに依存しないサリエンシーマップを生成可能となり、内側最適化ステップを損失関数内に組み込むことで、学習に関連する特徴量や敵対的摂動を特定するメタラーニングアプローチにより、特異性が向上する。
The different families of saliency methods, either based on contrastive signals, closed-form formulas mixing gradients with activations or on perturbation masks, all focus on which parts of an image are responsible for the model's inference. In this paper, we are rather interested by the locations of an image that contribute to the model's training. First, we propose a principled attribution method that we extract from the summation formula used to compute the gradient of the weights for a 1x1 convolutional layer. The resulting formula is fast to compute and can used throughout the network, allowing us to efficiently produce fined-grained importance maps. We will show how to extend it in order to compute saliency maps at any targeted point within the network. Secondly, to make the attribution really specific to the training of the model, we introduce a meta-learning approach for saliency methods by considering an inner optimisation step within the loss. This way, we do not aim at identifying the parts of an image that contribute to the model's output but rather the locations that are responsible for the good training of the model on this image. Conversely, we also show that a similar meta-learning approach can be used to extract the adversarial locations which can lead to the degradation of the model.
研究の動機と目的
- モデルの推論ではなく、学習中のモデル重みの勾配に最も寄与する画像領域を特定すること。
- 深層ネットワークのすべての層にわたる細粒度の属性マップを計算する、高速で閉形式の手法を開発すること。
- 損失関数内に内側最適化ステップを組み込むことで、学習プロセスに特化した手法に拡張すること。
- 適切な学習を助ける画素とモデルの劣化を引き起こす画素を区別し、敵対的場所の検出を可能にすること。
提案手法
- NormGradは、各空間的位置における活性化勾配と入力特徴量の外積のフロベニウスノルムを計算し、画素単位の重要度マップを形成する:$\bm{m}_u = \|\bm{g}_u\| \cdot \|\bm{x}'_u\|$。
- 一般化された畳み込み層では、勾配を$\frac{dh}{dW} = \frac{dh}{dX''} \cdot \iota(\bm{x}')$として表現するim2row変換が用いられ、局所的勾配寄与の効率的計算が可能になる。
- 任意のネットワーク層に1×1インジケータ畳み込みを挿入することで、任意の深さでサリエンシー計算が可能となり、勾配解析用に層を1×1畳み込みに変換する。
- 中間活性化を仮想の1×1畳み込みの入力とみなすことで、アーキテクチャの変更なしに任意の層に一般化可能となる。
- 1次ではメタラーニングアプローチが適用される:損失関数内に内側最適化ステップを組み込み、ヘッセ・ベクトル積を近似することで、学習ダイナミクスに特化したサリエンシーマップが得られる。
- 1次手法では有限差分とSGDを用いてヘッセ・ベクトル積を近似し、$\epsilon = 0.0005$および$h = 0.5 / \|\nabla_{\theta'}\ell\|_2$がハイパーパrameterとして設定される。
実験結果
リサーチクエスチョン
- RQ1深層ネットワークのバックプロパゲーション中に、勾配更新に最も影響を与える画像画素はどれか?
- RQ2閉形式で効率的な手法が、最終層に限らず任意の層で高解像度のサリエンシーマップを生成できるか?
- RQ3サリエンシーマップをモデル推論ではなく、学習プロセスに特化させることは可能か?
- RQ4同じフレームワークが、一元的なメタラーニング機構を用いて、学習に重要となる画素と敵対的画素の両方を検出できるか?
主な発見
- NormGradは、Grad-CAMが深い層でのみ意味のあるマップを生成するのに対し、初期層を含め任意のネットワーク深さで高解像度のサリエンシーマップを生成する。
- 1×1インジケータ畳み込みのテクニックにより、任意の層で一貫したサリエンシー計算が可能となり、このテクニックを用いなくても元の手法と同等の結果が得られる。
- 1次でないNormGrad手法はクラスに依存しない。これは、一般の勾配寄与を捉えているため、正しく分類されるクラスと敵対的クラスの両方に同じように強調する。
- 1次メタラーニング拡張により、クラス固有のサリエンシーマップが得られる:一方のバージョンは学習を改善する画素を強調し、もう一方は劣化を引き起こす画素を特定する。
- 1次でないNormGradは、1枚の画像あたり1回のフォワード・バックプロパゲーションで十分であり、学習中におけるリアルタイム利用に十分な効率性を有する。
- 1次手法は4回のフォワード・バックプロパゲーションを要するが、数百回のパスを要する摂動ベース手法に比べ、速度と解像度の両面で優れている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。