Skip to main content
QUICK REVIEW

[論文レビュー] Class Activation Map Generation by Representative Class Selection and Multi-Layer Feature Fusion

Fanman Meng, Kaixu Huang|arXiv (Cornell University)|Jan 23, 2019
Domain Adaptation and Few-Shot Learning参考文献 22被引用数 10
ひとこと要約

本論文は、二値分類用の代表的クラスの選択と多層特徴の統合を用いて、局所化精度を向上させる新しいクラス活性マップ(CAM)生成手法を提案する。クラスタリングを用いて判別性の高いクラスペアを同定し、高レベルと低レベルの特徴を活用することで、PASCAL VOCおよびCOCOデータセットで最先端の性能を達成した。ResNet-101を用いた場合、PASCAL VOC 2012で33.43%のmIoU、COCO 2017で15.41%のmIoUを達成した。

ABSTRACT

Existing method generates class activation map (CAM) by a set of fixed classes (i.e., using all the classes), while the discriminative cues between class pairs are not considered. Note that activation maps by considering different class pair are complementary, and therefore can provide more discriminative cues to overcome the shortcoming of the existing CAM generation that the highlighted regions are usually local part regions rather than global object regions due to the lack of object cues. In this paper, we generate CAM by using a few of representative classes, with aim of extracting more discriminative cues by considering each class pair to obtain CAM more globally. The advantages are twofold. Firstly, the representative classes are able to obtain activation regions that are complementary to each other, and therefore leads to generating activation map more accurately. Secondly, we only need to consider a small number of representative classes, making the CAM generation suitable for small networks. We propose a clustering based method to select the representative classes. Multiple binary classification models rather than a multiple class classification model are used to generate the CAM. Moreover, we propose a multi-layer fusion based CAM generation method to simultaneously combine high-level semantic features and low-level detail features. We validate the proposed method on the PASCAL VOC and COCO database in terms of segmentation groundtruth. Various networks such as classical network (Resnet-50, Resent-101 and Resnet-152) and small network (VGG-19, Resnet-18 and Mobilenet) are considered. Experimental results show that the proposed method improves the CAM generation obviously.

研究の動機と目的

  • すべてのクラスを比較対象として用いる従来のCAM手法の限界、すなわち局所的でグローバルでない活性領域を解消する。
  • 補完的な判別的手がかりを提供する少数の代表的クラスを選択することで、クラス間干渉の問題を克服する。
  • 単一の多クラスモデルではなく、複数の二値分類モデルを用いることで、小規模なニューラルネットワークでも効果的なCAM生成を可能にする。
  • 複数のネットワーク層における高レベルの意味的特徴と低レベルの詳細特徴を統合することで、特徴表現を向上させる。

提案手法

  • 分類類似度行列を用いて、全クラス集合から代表的クラスを同定するクラスタリングベースの手法を提案する。
  • クラスペア間の分類性能に基づいて類似度行列を構築し、クラスタリングをガイドする。
  • 改善版k-meansクラスタリングアルゴリズムを適用し、補完的な活性化手がかりを最大化する代表的クラスのサブセットを特定する。
  • 各ターゲットクラスをその代表的クラスと比較する複数の二値分類モデルを訓練し、個々のCAMを生成する。
  • 畳み込みニューラルネットワークの異なる層(例:Layer1からLayer4)からの活性化マップを統合する多層特徴統合戦略を採用し、意味的および空間的詳細を保持する。
  • 代表的クラスペアからの二値CAMを単純平均化戦略で統合し、最終的なより正確な活性化マップを生成する。

実験結果

リサーチクエスチョン

  • RQ1すべてのクラスではなく、代表的クラスのサブセットを選択することで、クラス活性マップのグローバル局所化が向上するか?
  • RQ2比較対象クラスの選択が、生成されたCAMの判別性および空間的カバー範囲にどのように影響するか?
  • RQ3異なるネットワーク深さからの意味的および空間的情報を統合することで、多層特徴統合がCAM品質を向上させるか?
  • RQ4本手法は、MobileNet や ResNet-18 などの小規模ニューラルネットワークでも、性能を維持または向上させるか?
  • RQ5標準ベンチマークにおけるmIoUの観点から、Grad-CAM、CAM、ACoL、CBAM などの既存のCAM生成技術と比較して、本手法はどのように差をつけるか?

主な発見

  • 本手法は、PASCAL VOC 2012の検証セットで33.43%のmIoUを達成し、ベースラインのGrad-CAM手法(27.94%)および他の最先端手法を顕著に上回った。
  • COCO 2017の検証セットでは15.41%のmIoUを達成し、以前の最高手法(CBAM)を5ポイント以上上回った。
  • アブレーションスタディにより、多層統合が2.56ポイント(12.85%から15.41%)の性能向上をもたらし、特徴統合の有効性を確認した。
  • 二値分類モデルを用いることで計算負荷が低減されるため、MobileNet や ResNet-18 などの小規模ネットワークでも良好な性能を発揮した。
  • 代表的クラス選択の導入により、質的比較で示されるように、本手法は部分領域ではなく物体全体を強調するよりグローバルに局所化された活性化マップを生成した。
  • COCOおよびPASCAL VOCにおいて、ACoL や CBAM は複雑なシーンにおけるオブジェクトの消去や注目マッピングのずれにより性能が低下するが、本手法はそれらを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。