Skip to main content
QUICK REVIEW

[論文レビュー] Class Re-Activation Maps for Weakly-Supervised Semantic Segmentation

Zhaozheng Chen, Tan Wang|arXiv (Cornell University)|Mar 2, 2022
Advanced Neural Network Applications被引用数 12
ひとこと要約

本稿では、バイナリクロスエントロピー(BCE)の代わりにソフトマックスクロスエントロピー(SCE)損失を用いてクラス活性化マップ(CAMs)を再活性化することで、弱教師ありセマンティックセグメンテーションを向上させるシンプルで効果的な手法ReCAMを提案する。BCEで訓練された収束済みモデルを、CAMから抽出した特徴量に対してSCEで微調整することにより、ReCAMは誤検出と誤検出を低減し、最小限の計算コストとCAMバリアントへのプラグアンドプレイ互換性を備えた最先端の性能を達成する。

ABSTRACT

Extracting class activation maps (CAM) is arguably the most standard step of generating pseudo masks for weakly-supervised semantic segmentation (WSSS). Yet, we find that the crux of the unsatisfactory pseudo masks is the binary cross-entropy loss (BCE) widely used in CAM. Specifically, due to the sum-over-class pooling nature of BCE, each pixel in CAM may be responsive to multiple classes co-occurring in the same receptive field. As a result, given a class, its hot CAM pixels may wrongly invade the area belonging to other classes, or the non-hot ones may be actually a part of the class. To this end, we introduce an embarrassingly simple yet surprisingly effective method: Reactivating the converged CAM with BCE by using softmax cross-entropy loss (SCE), dubbed extbf{ReCAM}. Given an image, we use CAM to extract the feature pixels of each single class, and use them with the class label to learn another fully-connected layer (after the backbone) with SCE. Once converged, we extract ReCAM in the same way as in CAM. Thanks to the contrastive nature of SCE, the pixel response is disentangled into different classes and hence less mask ambiguity is expected. The evaluation on both PASCAL VOC and MS~COCO shows that ReCAM not only generates high-quality masks, but also supports plug-and-play in any CAM variant with little overhead.

研究の動機と目的

  • 従来のCAMが弱教師ありセマンティックセグメンテーション(WSSS)で生成する品質の低い疑似マスクを是正すること、特にバイナリクロスエントロピー(BCE)損失の限界に起因するものである。
  • CAM生成においてBCEをソフトマックスクロスエントロピー(SCE)損失に置き換えることで、クラスの混同を低減し、マスクの正確性を向上させることを調査すること。
  • 既存のCAMベースのWSSSパイプラインを最小限の計算コストで向上させる、プラグアンドプレイ可能な手法を開発すること。
  • SCEベースの再活性化がクラス応答を分離することを実証的に検証し、標準ベンチマークでmIoUを向上させること。

提案手法

  • BCE損失を用いてマルチラベル分類器を訓練した後、ReCAMは最終畳み込み層からのクラス固有の特徴マップ(CAMs)を抽出する。
  • 各画像とそのラベル付きクラスに対して、ReCAMはそのクラスに対応するCAMピクセルを特定し、それらをサポート特徴として使用する。
  • 対応するクラスラベルを用いて、SCE損失を用いてこれらのサポート特徴量上で新たな全結合層を訓練する。これにより、そのクラスに対するモデルの再活性化が実現される。
  • この再訓練された層からの出力マップをReCAMと呼ぶ。これはSCEのクラス排他的学習と対照的正則化の恩恵を受ける。
  • ReCAMは、任意のCAMバリアントに最小限の推論コストでプラグアンドプレイ方式で適用可能である。
  • 本手法は、追加の精錬モジュール(例:IRN、AdvCAM)の有無に関わらず評価され、汎用性と効率性が示された。

実験結果

リサーチクエスチョン

  • RQ1CAM生成におけるBCE損失の代わりにSCE損失を用いることで、弱教師ありセマンティックセグメンテーションにおける誤検出および誤検出ピクセルを低減できるか?
  • RQ2BCEで訓練されたCAM特徴量に対してSCEを用いた単純な再活性化ステップが、アーキテクチャの変更なしに疑似マスク品質を顕著に向上させられるか?
  • RQ3ReCAMはλ(損失バランス重み)といったハイパーパrameterに対してどれほど感度を示すか?
  • RQ4ReCAMは異なるバックボーンアーキテクチャやセグメンテーションモデルにおいても性能向上を維持できるか?
  • RQ5ReCAMはIRNやAdvCAMのような既存の精錬手法と効果的に組み合わせられるか?また、それらの性能を向上させられるか?

主な発見

  • PASCAL VOC 2012の検証セットにおいて、ReCAMはアンサンブルCAMに対して6%のmIoU向上を達成し、UperNet-Swinでは6.1%、DeepLabV2では4.7%の向上を示した。
  • MS COCOにおいても、ReCAMはベースラインCAMを5.5%のmIoU向上で上回り、異なるデータセット間で一貫した向上効果を示した。
  • ReCAMはハイパーパrameterλに対して頑健であり、λ=1で最適な性能を示し、他の値に対しても最小限の性能低下にとどまり、低感度であることが示された。
  • IRNと組み合わせた場合、VOCでは70.9%のmIoUを達成し、AdvCAMを1%上回り、AdvCAMの160倍速く、IRN単体の8.2倍速くなった。
  • 単一ラベルおよび複数ラベル画像の両方において、ReCAMは優れた性能を維持し、それぞれ誤検出と誤検出を低減した。
  • Saliencyベースの手法とのプラグアンドプレイ統合をサポートし、VOCではEPS*で71.6%、EDAM*で72.2%のmIoUを達成し、すべてのベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。