Skip to main content
QUICK REVIEW

[論文レビュー] Shallow Feature Matters for Weakly Supervised Object Localization

Jun Wei, Qin Wang|arXiv (Cornell University)|Aug 2, 2021
Advanced Neural Network Applications参考文献 19被引用数 10
ひとこと要約

本稿では、浅い特徴量と深い特徴量を乗算結合によって統合することで背景ノイズを抑制し、境界の正確性を向上させる、新しい弱教師付きオブジェクト検出手法SPOLを提案する。疑似ラベル戦略とガウス事前分布の強化を組み合わせ、クラスに依存しないセグメンテーションヘッドを用いることで、CUB-200ではトップ5検出精度を3.93%、ImageNet-1Kでは2.13%向上させ、最先端性能を達成した。

ABSTRACT

Weakly supervised object localization (WSOL) aims to localize objects by only utilizing image-level labels. Class activation maps (CAMs) are the commonly used features to achieve WSOL. However, previous CAM-based methods did not take full advantage of the shallow features, despite their importance for WSOL. Because shallow features are easily buried in background noise through conventional fusion. In this paper, we propose a simple but effective Shallow feature-aware Pseudo supervised Object Localization (SPOL) model for accurate WSOL, which makes the utmost of low-level features embedded in shallow layers. In practice, our SPOL model first generates the CAMs through a novel element-wise multiplication of shallow and deep feature maps, which filters the background noise and generates sharper boundaries robustly. Besides, we further propose a general class-agnostic segmentation model to achieve the accurate object mask, by only using the initial CAMs as the pseudo label without any extra annotation. Eventually, a bounding box extractor is applied to the object mask to locate the target. Experiments verify that our SPOL outperforms the state-of-the-art on both CUB-200 and ImageNet-1K benchmarks, achieving 93.44% and 67.15% (i.e., 3.93% and 2.13% improvement) Top-5 localization accuracy, respectively.

研究の動機と目的

  • 従来の特徴量統合戦略では背景ノイズに圧倒されがちな、既存の弱教師付きオブジェクト検出(WSOL)手法における浅い特徴量の未利用状態を是正すること。
  • 浅い特徴量と深い特徴量の協調的統合により、オブジェクト境界の明確化と誤検出の低減を図ることで、検出精度を向上させること。
  • 初期のクラスアクティビティマップ(CAM)を、疑似ラベルで学習されたクラスに依存しないセグメンテーションモデルを用いて、より完全なオブジェクトマスクへと精錬すること。
  • バウンディングボックスのアノテーションを一切不要とし、画像レベルのラベルに依存してガウス事前分布モデリングにより高品質な疑似ラベルを生成すること。

提案手法

  • 要素ごとの乗算により浅い特徴マップと深い特徴マップを統合する、乗算型特徴量統合ネットワーク(MFF-Net)を提案。これによりノイズの相互抑制とオブジェクト境界の強化が可能となる。
  • CAM応答の全空間的位置における平均と分散を計算することで、オブジェクトの重心に注目する空間的事前分布を生成する、ガウス事前分布疑似ラベル(GPPL)モジュールを導入。
  • 統合されたCAMとGPPLを疑似ラベルとして用い、クラスに依存しないセグメンテーションモデルを学習。このモデルは部分的なアクティベーションを補完することでオブジェクトマスクを精錬する。
  • 訓練中のラベル競合を解消するために、二段階のしきい値処理を適用:高応答領域をフォアグラウンド、低応答領域をバックグラウンドとし、中間領域は無視する。
  • 特徴表現の向上とノイズ抑制を図るため、MFF-Netに補助損失および乗算型チャネルワイドアテンション(MCA)を導入。
  • 最終的に精錬されたマスクからバウンディングボックス抽出器を適用し、最終的なオブジェクト検出予測を生成する。
Figure 1: (a) CAM-based pipeline for Weakly Supervised Object Localization (WSOL). $\mathcal{F}$ represents different fusion strategies. Here multiplication and addition based fusion methods for CAMs are compared. (b) GT-known Loc comparison using fused CAMs through different fusion strategies from
Figure 1: (a) CAM-based pipeline for Weakly Supervised Object Localization (WSOL). $\mathcal{F}$ represents different fusion strategies. Here multiplication and addition based fusion methods for CAMs are compared. (b) GT-known Loc comparison using fused CAMs through different fusion strategies from

実験結果

リサーチクエスチョン

  • RQ1ノイズが多いにもかかわらず、適切に深い特徴量と統合された浅い特徴量は、弱教師付きオブジェクト検出において有効に活用可能だろうか?
  • RQ2浅い特徴量と深い特徴量の乗算統合は、加算的または連結的統合に比べ、オブジェクト境界の保持と背景応答の抑制において優れているだろうか?
  • RQ3初期のCAMとガウス事前分布から導出された疑似ラベルで学習されたクラスに依存しないセグメンテーションモデルは、オブジェクトマスクの完全性と検出精度を顕著に向上させられるだろうか?
  • RQ4MCA、補助損失、しきい値処理、ガウス強化といった各モジュールが、最終的な検出性能に与える影響は何か?

主な発見

  • CUB-200ではSPOLがトップ5検出精度93.44%を達成し、前回の最先端手法比で3.93%の向上を示した。
  • ImageNet-1KではSPOLが67.15%のトップ5検出精度を達成し、前回の最先端手法比で2.13%の向上を示した。
  • 除去実験では、乗算型チャネルワイドアテンション(MCA)モジュールを削除すると、GT-Known Locが92.25%から88.52%に低下し、ノイズ抑制におけるその重要性が示された。
  • 補助損失を削除すると、GT-Known Locが92.25%から89.45%に低下し、モデルの収束性向上に寄与していることが示された。
  • クラスに依存しないセグメンテーションモデルは顕著な性能向上をもたらした。これを削除すると、GT-Known Locは96.46%から92.25%に低下した。
  • しきい値処理とガウス強化の両方が不可欠であることが判明。両方を省略すると、それぞれ95.41%(w/o Gauss Enhance)および73.97%(w/o Threshold)のGT-Known Locに顕著な低下が見られた。
Figure 2: Variants of activated regions. (a) Input image. (b) Original CAM [ 28 ] . (c) Gaussian prior pseudo labels using original CAM as the weighting coefficients. (d) Gaussian prior pseudo labels combined with original CAM. (e) Object mask predicted by the proposed class-agnostic segmentation mo
Figure 2: Variants of activated regions. (a) Input image. (b) Original CAM [ 28 ] . (c) Gaussian prior pseudo labels using original CAM as the weighting coefficients. (d) Gaussian prior pseudo labels combined with original CAM. (e) Object mask predicted by the proposed class-agnostic segmentation mo

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。