Skip to main content
QUICK REVIEW

[論文レビュー] Complementary Patch for Weakly Supervised Semantic Segmentation

Fei Zhang, Chaochen Gu|arXiv (Cornell University)|Aug 9, 2021
Advanced Neural Network Applications参考文献 43被引用数 9
ひとこと要約

本稿では、画像ラベルのみを用いて弱教師付きセマンティックセグメンテーションを向上させるために、補完的パッチ(CP)表現とCPネットワーク(CPN)を提案する。情報理論を活用することで、補完的隠しパッチを有するペaired画像を用いて、より情報豊かなCAM(Class Activation Maps)を生成する。これにより、VOC 2012の検証セットで67.8%、CRFの微調整を施したテストセットで68.5%という最先端のmIoUを達成した。

ABSTRACT

Weakly Supervised Semantic Segmentation (WSSS) based on image-level labels has been greatly advanced by exploiting the outputs of Class Activation Map (CAM) to generate the pseudo labels for semantic segmentation. However, CAM merely discovers seeds from a small number of regions, which may be insufficient to serve as pseudo masks for semantic segmentation. In this paper, we formulate the expansion of object regions in CAM as an increase in information. From the perspective of information theory, we propose a novel Complementary Patch (CP) Representation and prove that the information of the sum of the CAMs by a pair of input images with complementary hidden (patched) parts, namely CP Pair, is greater than or equal to the information of the baseline CAM. Therefore, a CAM with more information related to object seeds can be obtained by narrowing down the gap between the sum of CAMs generated by the CP Pair and the original CAM. We propose a CP Network (CPN) implemented by a triplet network and three regularization functions. To further improve the quality of the CAMs, we propose a Pixel-Region Correlation Module (PRCM) to augment the contextual information by using object-region relations between the feature maps and the CAMs. Experimental results on the PASCAL VOC 2012 datasets show that our proposed method achieves a new state-of-the-art in WSSS, validating the effectiveness of our CP Representation and CPN.

研究の動機と目的

  • クラスアクティベーションマップ(CAM)の限界を解消する。特に、疎な活性化により完全なオブジェクト領域が欠落する問題を是正する。
  • 反復的な領域の消去やマスク処理の非効率性と不安定性を、原理的で情報理論に基づいたアプローチによって克服する。
  • ペアド画像の補完的情報(隠し領域付き)を活用することで、CAMの品質を向上させ、種まき領域の発見性を高める。
  • オリジナルのCAMと強化されたCAMの乖離を最小限に抑えるために、三重構造と正則化を備えた新しいCPネットワーク(CPN)を開発する。
  • ピクセルと領域の相関関係をよりよく捉えるために、ピクセル・リージョン相関モジュール(PRCM)を用いてセグメンテーション予測を微調整する。

提案手法

  • 情報理論に基づいた補完的パッチ(CP)表現を提案し、CPペア(補完的隠しパッチを有する2枚の画像)からのCAMの和が、元のCAMよりも情報量が多いことを理論的に証明する。
  • 三重ネットワークを用い、三重CP(TCP)損失とCPクロス正則化(CPCR)を導入することで、強化されたCAMとオリジナルのCAMの差を最小化するCPネットワーク(CPN)を設計する。
  • グリッドベースまたはスーパーピクセルベースのパッチテンプレートを用いてCPペアを生成し、隠し領域の分布を制御し、補完性を保証する。
  • 特徴マップのピクセルとオブジェクト領域との関係をモデル化するピクセル・リージョン相関モジュール(PRCM)を導入し、CAMの一貫性と文脈認識能力を向上させる。
  • 疑似セグメンテーションマスクのさらなる微調整のために、ランダムウォークとCRFの後処理を適用し、最終的なmIoUスコアを向上させる。
  • 境界ボックス、スクラッチ、ピクセルレベルのアノテーションを一切不要とし、画像ラベルのみでエンドツーエンドにモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1補完的隠しパッチを有する2枚の画像からのCAMの和は、単一のCAMよりも、より情報豊かなオブジェクトの種まき領域を提供できるか?
  • RQ2パッチサイズと隠し確率がCPフレームワークにおける情報量の増加とセグメンテーション性能に与える影響は何か?
  • RQ3特定の正則化を備えた三重構造ネットワークは、CPペアを用いてCAMを効果的に強化する学習を可能にするか?
  • RQ4ピクセルと領域の関係性を組み込むことで、CAMの品質とセグメンテーション精度はどの程度向上するか?
  • RQ5提案されたCPNは、弱教師付き条件下でPASCAL VOC 2012のような標準ベンチマークで最先端の性能を達成できるか?

主な発見

  • CP表現は情報理論に基づき理論的に正当化されており、CPペアからのCAMの和が、オリジナルのCAMと同等以上に情報量を有することを証明した。
  • CPNは、CRF微調整を施した場合、PASCAL VOC 2012の検証セットで67.8%、テストセットで68.5%という新たな最先端のmIoUを達成した。
  • CRFを用いない場合でも、検証セットで66.8%、テストセットで67.6%のmIoUを達成し、追加の教師信号なしにMCISや他の最先端手法を上回った。
  • 隠し確率 $p_h$ が低すぎると(例:0.1)、理論的極限ケース(CPペア内の1枚の画像が元の画像にほぼ同一になる)に一致して性能が低下した。
  • グリッドベースのパッチは、スーパーピクセルパッチ(1.45 sec/image)と比較して著しく高速(0.006 sec/image)であり、リアルタイム応用に適している。
  • ピクセル・リージョン相関モジュール(PRCM)は、特徴とオブジェクト領域との文脈的関係をモデル化することで、CAMの一貫性とセグメンテーション品質の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。