Skip to main content
QUICK REVIEW

[論文レビュー] Self-supervised Scale Equivariant Network for Weakly Supervised Semantic Segmentation

Yude Wang, Jie Zhang|arXiv (Cornell University)|Sep 9, 2019
Advanced Neural Network Applications参考文献 28被引用数 22
ひとこと要約

本論文では、画像レベルラベルのみを用いて弱教師ありセマンティックセグメンテーションの性能を向上させるために、クラスアクティベーションマップ(CAMs)におけるスケール等変性を強制する新しい正則化損失を用いた自己教師付きスケール等変性ネットワーク(SSENet)を提案する。異なる画像スケールにおいて一貫したCAMを保証することで、過剰活性化および不十分活性化の問題を軽減し、PASCAL VOC 2012で最先端の性能を達成する。

ABSTRACT

Weakly supervised semantic segmentation has attracted much research interest in recent years considering its advantage of low labeling cost. Most of the advanced algorithms follow the design principle that expands and constrains the seed regions from class activation maps (CAM). As well-known, conventional CAM tends to be incomplete or over-activated due to weak supervision. Fortunately, we find that semantic segmentation has a characteristic of spatial transformation equivariance, which can form a few self-supervisions to help weakly supervised learning. This work mainly explores the advantages of scale equivariant constrains for CAM generation, formulated as a self-supervised scale equivariant network (SSENet). Specifically, a novel scale equivariant regularization is elaborately designed to ensure consistency of CAMs from the same input image with different resolutions. This novel scale equivariant regularization can guide the whole network to learn more accurate class activation. This regularized CAM can be embedded in most recent advanced weakly supervised semantic segmentation framework. Extensive experiments on PASCAL VOC 2012 datasets demonstrate that our method achieves the state-of-the-art performance both quantitatively and qualitatively for weakly supervised semantic segmentation. Code has been made available.

研究の動機と目的

  • 異なる画像スケールにおけるクラスアクティベーションマップ(CAMs)の不一致が弱教師ありセマンティックセグメンテーションの性能を低下させることを是正すること。
  • 追加のアノテーションを必要とせずにCAM品質を向上させる手段として自己教師あり学習を活用すること。
  • CAMにスケール等変性を強制する正則化手法を開発し、スケール変換された入力において一貫した活性化パターンを保証すること。
  • 提案手法を既存の弱教師ありセグメンテーションフレームワークに統合し、性能向上を図ること。
  • 画像レベルの監視のみを用いてPASCAL VOC 2012で最先端の結果を達成すること。

提案手法

  • 同じ画像を複数のスケールで処理する二本のブランチを持つネットワークアーキテクチャを提案し、スケール等変性を強制する。
  • 空間変換後の同じ画像の異なる解像度におけるCAMの差を最小化するスケール等変性正則化(SER)損失を導入する。
  • 入力画像に空間変換(例:リスケーリング)を適用し、逆ワープを用いてCAMを補正して監視信号とする。
  • 正則化されたCAMを標準的な弱教師ありセマンティックセグメンテーションパイプラインにおける偽セグメンテーションラベルとして使用する。
  • ResNet-38バックボーンを搭載したAffinityNet や DeepLab といった最先端のフレームワークに本手法を統合する。
  • 追加のアノテーションに依存せずに、スケールの一貫性を監視信号として活用する自己教師あり学習の枠組みを採用する。

実験結果

リサーチクエスチョン

  • RQ1クラスアクティベーションマップ(CAMs)におけるスケール等変性を強制することで、弱教師ありセマンティックセグメンテーションにおける偽セグメンテーションラベルの品質が向上するか?
  • RQ2スケール等変性正則化は、異なる画像スケールにおけるCAMの過剰活性化および不十分活性化をどのように軽減するか?
  • RQ3自己教師ありスケール一貫性は、画像レベルの弱教師あり学習における有効なインダクティブバイアスとして機能するか?
  • RQ4提案手法は、より強い監視信号(例:バウンディングボックス、スクラッチ、ポイント)を用いる最先端手法と比較して、どの程度性能向上を達成するか?
  • RQ5本手法は、異なるバックボーンアーキテクチャおよびセグメンテーションフレームワークに一般化可能か?

主な発見

  • SSENetはPASCAL VOC 2012のテストセットで64.9%のmIoUを達成し、ベースラインのAffinityNetや他の最先端手法を上回る性能を示した。
  • 特に大きなオブジェクトにおいて、CAMの一貫性が向上することで、誤検出領域(m_FP)が減少し、真陽性カバレッジ(m_FN)が向上した。
  • スケール等変性正則化により、定量的解析によるm_FPおよびm_FN曲線の観点から、小さなオブジェクトにおける過剰活性化と大きなオブジェクトにおける不十分活性化が顕著に軽減された。
  • バウンディングボックス、スクラッチ、ポイントといったより強い監視信号を用いる手法と比較しても、画像レベルラベルのみを用いるにもかかわらず、競争力のある性能を達成した。
  • アブレーションスタディにより、SER損失が性能向上の主因であることが確認され、向上したCAMがセグメンテーション学習におけるより良い偽ラベルをもたらした。
  • 本手法は容易に統合可能であり、アーキテクチャの変更なしに既存の弱教師ありフレームワークを強化できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。