Skip to main content
QUICK REVIEW

[論文レビュー] Visual Explanation for Deep Metric Learning

Sijie Zhu, Taojiannan Yang|arXiv (Cornell University)|Sep 27, 2019
Human Pose and Action Recognition参考文献 37被引用数 14
ひとこと要約

本論文は、深層度画像学習における視覚的説明のための新規な活性化分解フレームワークを提案し、画像間のピクセル対ピクセルの対応関係を明らかにするピクセル特化型活性化マップを導入する。類似度スコアを領域レベルの寄与に分解することで、口対口や目対目の一致といった詳細な関係を解明し、クロスビューパターン発見やインタラクティブリtrievalといった応用において、従来のGrad-CAMスタイルの手法よりも優れた解釈可能性を示している。

ABSTRACT

This work explores the visual explanation for deep metric learning and its applications. As an important problem for learning representation, metric learning has attracted much attention recently, while the interpretation of such model is not as well studied as classification. To this end, we propose an intuitive idea to show where contributes the most to the overall similarity of two input images by decomposing the final activation. Instead of only providing the overall activation map of each image, we propose to generate point-to-point activation intensity between two images so that the relationship between different regions is uncovered. We show that the proposed framework can be directly deployed to a large range of metric learning applications and provides valuable information for understanding the model. Furthermore, our experiments show its effectiveness on two potential applications, i.e. cross-view pattern discovery and interactive retrieval. The source code is available at \url{https://github.com/Jeff-Zilence/Explain_Metric_Learning}.

研究の動機と目的

  • 深層度画像学習における視覚的説明の欠如、特に類似度スコアに最も寄与する画像領域を理解するためのもの。
  • グローバル活性化マップが明らかにできない範囲での、2枚の画像間の対応領域の関係を解明するためのもの。
  • アーキテクチャの変更なしに多様な度画像学習タスクに適用可能なホワイトボックス説明手法を開発するためのもの。
  • クロスビューパターン発見やインタラクティブリtrievalといった実世界の応用において、ピクセル特化型活性化マップの有効性を検証するためのもの。

提案手法

  • 1枚の画像の各空間的位置が、別の画像との総合類似度スコアに与える寄与を計算するための活性化分解を提案する。
  • 両方の画像の最終畳み込み特徴マップに対して類似度スコアの勾配を計算することで、度画像学習へのGrad-CAMの拡張を実現する。
  • チェーンルールを用いて勾配に基づく活性化マップを導出する。ここで勾配は、コサイン類似度スコアから特徴マップへ逆伝播される。
  • 1枚の画像の1ピクセルの活性化応答を、もう1枚の画像の全位置に対して計算することで、ピクセル特化型活性化マップを導入する。
  • グローバル平均プーリング(GAP)とジャコビアンベースの勾配計算を用いて、クラスに依存せず、アーキテクチャに依存しない視覚的説明を生成する。
  • L2正規化された埋め込みを用いたシアンプルネットワークにこの手法を適用し、再訓練やモデルの変更なしに説明を可能にする。

実験結果

リサーチクエスチョン

  • RQ12枚の画像の間で、深層度画像学習において学習された類似度スコアに最も寄与する領域をどのように可視化できるか?
  • RQ22枚の画像間の対応領域(例:目、口)の関係は何か? そして、その関係はどのように定量的に測定できるか?
  • RQ3ピクセル特化型活性化マップは、グローバル活性化マップを上回る解釈性を度画像学習で向上させることができるか?
  • RQ4本手法は、クロスビューパターン発見やインタラクティブリtrievalといった実世界の応用において、どの程度有効であるか?
  • RQ5本手法の説明フレームワークは、口対口や目対目のような詳細な一致パターンを捉える点で、Grad-CAMなどの従来手法を上回るか?

主な発見

  • 提案された活性化分解手法は、全体的およびピクセル特化型の活性化マップを生成し、画像間の詳細な空間的対応関係を明らかにする。
  • ピクセル特化型活性化マップは、低活性化領域(例:人物再識別画像における口)が、特定の特徴(例:クエリ画像における口)に対して強い応答を示すことがあることを示しており、これはグローバルマップでは捉えられない。
  • 実験により、特にGAPプーリングを用いた人物再識別において、本手法はクローリングやマスキングベースラインを上回る意味のある活性化マップを生成することが示された。
  • クロスビューパターン発見の文脈では、異なる視点間で一貫したパターン(例:顔の向き)を効果的に同定できた。
  • インタラクティブリtrieバルの結果、ユーザーはピクセル特化型マップで特定された高応答領域に注目することで、効果的に検索を最適化できた。
  • 本手法は、顔認識、人物再識別、画像リtrieバルなど多様な度画像学習タスクにわたり、モデルの再訓練を必要とせずに有効であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。