[論文レビュー] Extracting Class Activation Maps from Non-Discriminative Features as well
本稿では、局所的特徴をプロトタイプにクラスタリングすることで、判別的でない局所的特徴も捉えるクラス活性化マップ(CAM)を生成する新規手法Local Prototype CAM(LPCAM)を提案する。標準の分類器重みの代わりにプロトタイプに基づく類似度マップを用い、各プロトタイプごとに個別に正規化することで、弱教師付きセマンティックセグメンテーションにおいて完全なオブジェクトカバレッジを達成し、計算コストの増加を最小限に抑えつつ、PASCAL VOCおよびMS COCOで最先端の手法を上回る性能を発揮する。
Extracting class activation maps (CAM) from a classification model often results in poor coverage on foreground objects, i.e., only the discriminative region (e.g., the "head" of "sheep") is recognized and the rest (e.g., the "leg" of "sheep") mistakenly as background. The crux behind is that the weight of the classifier (used to compute CAM) captures only the discriminative features of objects. We tackle this by introducing a new computation method for CAM that explicitly captures non-discriminative features as well, thereby expanding CAM to cover whole objects. Specifically, we omit the last pooling layer of the classification model, and perform clustering on all local features of an object class, where "local" means "at a spatial pixel position". We call the resultant K cluster centers local prototypes - represent local semantics like the "head", "leg", and "body" of "sheep". Given a new image of the class, we compare its unpooled features to every prototype, derive K similarity matrices, and then aggregate them into a heatmap (i.e., our CAM). Our CAM thus captures all local features of the class without discrimination. We evaluate it in the challenging tasks of weakly-supervised semantic segmentation (WSSS), and plug it in multiple state-of-the-art WSSS methods, such as MCTformer and AMN, by simply replacing their original CAM with ours. Our extensive experiments on standard WSSS benchmarks (PASCAL VOC and MS COCO) show the superiority of our method: consistent improvements with little computational overhead.
研究の動機と目的
- 従来のクラス活性化マップ(CAM)がしばしば非判別的領域(例:オブジェクトの脚や尾)を欠落させるという、前景オブジェクトのカバレッジが悪い問題に対処する。
- 標準CAMが判別的特徴に偏る問題を解消するため、分類器重みをプロトタイプに基づく表現に置き換える。
- 局所的意味(例:「頭」「脚」「体躯」)を保持するとともに、混乱する文脈(例:「列車」に対して「レール」)による誤検出を軽減する手法を開発する。
- アーキテクチャの変更なしに統合可能な、従来のCAMの即時置き換え可能な代替手法を提供し、弱教師付きセマンティックセグメンテーション(WSSS)における性能を最小限の計算コストで向上させる。
提案手法
- 最終分類器の手前でグローバル平均プーリング層を省略し、分類モデル内で全空間的局所特徴を保持する。
- すべての訓練画像における局所特徴(クラスごと)をK個の局所的プロトタイプにクラスタリングし、それぞれが明確な局所的意味的パーツ(例:「羊」の「頭」「脚」)を表す。
- 与えられた画像について、特徴マップと各局所的プロトタイプとの間でコサイン距離を用いてK個の類似度マップを計算し、各マップごとに個別に正規化することで非判別的領域を保持する。
- 正規化された類似度マップを平均することで最終的なヒートマップ(Local Prototype CAM:LPCAM)を生成する。
- 背景要因と強く共起する要因による誤検出を抑制するため、画像特徴とクラスタリングされた文脈プロトタイプとの間で類似度マップを計算し、それをLPCAMから差し引くことでLPCAMを拡張する。
- 従来のCAM計算ステップを置き換えることで、既存のWSSSパイプラインにLPCAMを統合し、セグメンテーションモデルのアーキテクチャに変更を加える必要がない。

実験結果
リサーチクエスチョン
- RQ1プールされていない特徴から導出されるプロトタイプベース分類器は、従来の分類器重みと比較して、CAMにおけるオブジェクトカバレッジを向上させることができるか?
- RQ2プロトタイプベース類似度マップごとに個別に正規化することで、従来のCAMが無視しがちな非判別的特徴が保持されるか?
- RQ3LPCAMは、混乱する文脈(例:「列車」に対して「レール」)による誤検出をどの程度軽減できるか、かつ完全なオブジェクトカバレッジを維持できるか?
- RQ4異なるバックボーンや事前学習戦略を用いた多数の最先端WSSS手法にLPCAMを統合した場合、その性能はどの程度向上するか?
主な発見
- AMNを用いた場合、PASCAL VOC 2012の検証セットで70.1%のmIoU、テストセットで70.4%のmIoUを達成し、最先端の性能を発揮する。
- より困難なMS COCOデータセットにおいても、WRN-38をベースにした場合、AMN+LPCAMは元のAMNおよび先行するすべてのSOTA手法を上回り、45.5%のmIoUを達成する。
- IRN、MCTformer、EDAMを含む多数のWSSS手法において、mIoUが0.6–0.8ポイント向上し、VOCおよびCOCOの両方で一貫した向上が得られる。
- 感度分析の結果、LPCAMはハイパーパramータの変更に対して頑健であり、特徴選択およびクラスタリングのための閾値を変更しても性能低下が最小限に抑えられる。
- 定性的な結果では、LPCAMが非判別的パーツ(例:脚、尾)を捉え、文脈アーチファクト(例:「サーフボード」画像における「波」)を抑制することが示され、一部では「列車」と強く共起する文脈(例:「鉄道」)が過剰に活性化される場合がある。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。