Skip to main content
QUICK REVIEW

[論文レビュー] Reliability Does Matter: An End-to-End Weakly Supervised Semantic Segmentation Approach

Bingfeng Zhang, Jimin Xiao|arXiv (Cornell University)|Nov 19, 2019
Advanced Neural Network Applications参考文献 38被引用数 22
ひとこと要約

本稿では、画像ラベルを用いてクラス活性化マップ(CAM)から信頼性の高い高信頼度ピクセル領域をマイニングする、シンプルで効果的なワンステップエンドツーエンド弱教師付きセマンティックセグメンテーション手法であるReliable Region Mining(RRM)を提案する。これらの剪定済みで信頼性の高い領域を、新しい密度エネルギー損失を用いて直接セグメンテーションブランチに訓練することで、SOTA性能(Pascal VOCの検証時62.6 mIoU、テスト時62.9 mIoU)を達成した。これは、複雑な二段階手法や、拡張した二段階学習を用いた場合にも、新たなSOTAを確立している(検証時66.3 mIoU、テスト時66.5 mIoU)。

ABSTRACT

Weakly supervised semantic segmentation is a challenging task as it only takes image-level information as supervision for training but produces pixel-level predictions for testing. To address such a challenging task, most recent state-of-the-art approaches propose to adopt two-step solutions, \emph{i.e. } 1) learn to generate pseudo pixel-level masks, and 2) engage FCNs to train the semantic segmentation networks with the pseudo masks. However, the two-step solutions usually employ many bells and whistles in producing high-quality pseudo masks, making this kind of methods complicated and inelegant. In this work, we harness the image-level labels to produce reliable pixel-level annotations and design a fully end-to-end network to learn to predict segmentation maps. Concretely, we firstly leverage an image classification branch to generate class activation maps for the annotated categories, which are further pruned into confident yet tiny object/background regions. Such reliable regions are then directly served as ground-truth labels for the parallel segmentation branch, where a newly designed dense energy loss function is adopted for optimization. Despite its apparent simplicity, our one-step solution achieves competitive mIoU scores (\emph{val}: 62.6, \emph{test}: 62.9) on Pascal VOC compared with those two-step state-of-the-arts. By extending our one-step method to two-step, we get a new state-of-the-art performance on the Pascal VOC (\emph{val}: 66.3, \emph{test}: 66.5).

研究の動機と目的

  • 多数の補助コンponentを用いて疑似マスクを生成する必要がある、従来の二段階弱教師付きセマンティックセグメンテーション手法の複雑さと不自然さを解消すること。
  • 従来のエンドツーエンド手法で見られる性能ギャップを回避する、信頼性の高い最小限の監視戦略を導入することで、ワンステップ手法の性能を向上させること。
  • 画像ラベルのみを用いて、より単純で直接的な学習パイプラインで高品質なセグメンテーションを達成できることを示すこと。
  • クラス活性化マップから、小さな高応答領域をマイニングすることで、全体オブジェクトや密度の高い疑似マスク生成よりも優れた監視が得られることを示すこと。
  • 追加データや複雑な補助機能を一切使用せず、画像ラベルのみで、画像ラベル弱教師付きセマンティックセグメンテーション分野における新たなSOTA性能を確立すること。

提案手法

  • 二本のブランチを持つネットワークを採用:一つは画像分類用でクラス活性化マップ(CAM)を生成し、もう一つはピクセルレベルの予測を行うセグメンテーションブランチ。
  • CAMから、オブジェクトやバックグラウンドに対応する高応答でコンactな領域(しばしば小さな領域)を特定し、高い活性化スコアゆえに信頼性が高いとみなす。
  • これらの信頼性のある領域は、条件付きランダムフィールド(CRF)を用いてノイズを除去し、局所化精度を向上させる。
  • 剪定済みの信頼性のある領域を、疑似マスクの代わりにセグメンテーションブランチの直接的な教師信号として使用する。
  • 新しい密度エネルギー損失を導入し、ピクセル単位の交差エントロピーと、低レベル特徴(RGBと空間的コンテキスト)を活用する正則化項を組み合わせることで、特徴学習を向上させる。
  • 交差エントロピーと密度エネルギー損失を統合したジョイント損失関数を用いて、画像ラベルからの直接的なセグメンテーション性能最適化が可能なエンドツーエンドの学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1複雑な二段階疑似マスク生成パイプラインに依存しない、ワンステップでエンドツーエンドの弱教師付きセマンティックセグメンテーション手法が、競争力のある性能を達成できるか?
  • RQ2クラス活性化マップから最も信頼性の高い高応答領域のみをマイニングすることで、全体オブジェクトや密度の高い疑似マスク生成よりも優れたセグメンテーション性能が得られるか?
  • RQ3画像ラベルのみで、少数の高信頼度ピクセルを用いるシンプルで最小限の監視戦略が、多数の補助信号や複雑な機能を用いるより複雑な手法を上回る性能を発揮できるか?
  • RQ4低レベル特徴を統合する本手法の密度エネルギー損失は、弱教師付き設定において標準的な交差エントロピー損失と比較して、どのようにセグメンテーション品質を向上させるか?
  • RQ5提案手法のワンステップ手法を二段階フレームワークに拡張することで、さらなる性能向上が可能か?また、それは新たなSOTAを達成するか?

主な発見

  • ワンステップのRRM手法は、Pascal VOCの検証セットで62.6 mIoU、テストセットで62.9 mIoUを達成し、EM-Adaptなどの既存のエンドツーエンド手法を上回り、ワンステップ手法における新たなSOTAを確立した。
  • 同じRRMネットワークを用いて疑似マスクを生成する二段階フレームワークに拡張した場合、検証時66.3 mIoU、テスト時66.5 mIoUを達成し、以前のSOTA(FickleNetの64.9/65.3)およびAffinityNetを上回った。追加データや補助信号を一切使用していないにもかかわらずである。
  • 三つの別々のDNNとResNet-38(ResNet-101よりも強力なバックボーン)を用いるAffinityNetでさえも、RRMの設計が単一のエンドツーエンドネットワークで効果的であることを示している。
  • 定性的な結果から、RRMは特に小さなオブジェクトや複雑なオブジェクトに対して、EM-Adaptよりも正確で境界に鋭いセグメンテーションを生成している。
  • アブレーションスタディにより、密度エネルギー損失が低レベル特徴を活用することで性能が著しく向上することが確認され、CRFの前処理によりマイニング領域の信頼性が向上している。
  • 本手法は、オブジェクト提案やサリエンシーマップ、複数のネットワークに依存する現在の二段階SOTA手法よりも、はるかにシンプルで洗練されており、少ないコンponentでより優れた性能を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。