[論文レビュー] Towards Single Stage Weakly Supervised Semantic Segmentation
本論文は、事前学習バックボーンや段階的精錬を必要とせず、画像レベルラベルではなく点アノテーションのみを用いて信頼性の高い疑似マスクを生成する、ワンステージ弱教師付きセマンティックセグメンテーション手法を提案する。反復的な散乱とランダムウォークを用いた点ブロブの導入、空間的に正確な特徴精錬のための拡張距離関数の活用により、Pascal VOC 2012 というベンチマークデータセットおよび CRAID, CityPersons, IAD という実世界データセットの両方で最先端性能を達成し、先行する SOTA メソッドを大きく上回る。
The costly process of obtaining semantic segmentation labels has driven research towards weakly supervised semantic segmentation (WSSS) methods, using only image-level, point, or box labels. The lack of dense scene representation requires methods to increase complexity to obtain additional semantic information about the scene, often done through multiple stages of training and refinement. Current state-of-the-art (SOTA) models leverage image-level labels to produce class activation maps (CAMs) which go through multiple stages of refinement before they are thresholded to make pseudo-masks for supervision. The multi-stage approach is computationally expensive, and dependency on image-level labels for CAMs generation lacks generalizability to more complex scenes. In contrary, our method offers a single-stage approach generalizable to arbitrary dataset, that is trainable from scratch, without any dependency on pre-trained backbones, classification, or separate refinement tasks. We utilize point annotations to generate reliable, on-the-fly pseudo-masks through refined and filtered features. While our method requires point annotations that are only slightly more expensive than image-level annotations, we are to demonstrate SOTA performance on benchmark datasets (PascalVOC 2012), as well as significantly outperform other SOTA WSSS methods on recent real-world datasets (CRAID, CityPersons, IAD).
研究の動機と目的
- 高価なトレーニングパイプラインや事前学習バックボーンに依存する多段階弱教師付きセマンティックセグメンテーション手法の限界を解消すること。
- ノイズの多いクラス活性化マップを生じさせ、小規模または多数のオブジェクトを含む複雑なシーンで失敗する画像レベルラベルへの依存度を低減すること。
- 事前学習モデルが利用可能でない、あるいは効果を発揮しない非ベンチマークの実世界データセットにおいても、効果的なセマンティックセグメンテーションを可能にすること。
- 事前学習バックボーンに依存せず、わずかに画像レベルラベルよりコストの高い点アノテーションのみを用いて、トレーニングからスクラッチで学習可能な汎用的で強力な手法を開発すること。
提案手法
- 点生成部は、反復的なアフィン変形とランダムウォークを用いて、スパarsely 定義されたユーザー指定点を点ブロブに変換することで、密集的かつ信頼性の高い疑似マスクを生成する。
- 点ブロブは、画像レベルラベルや事前学習分類器の代わりに、特徴学習をガイドする空間的監視信号として用いられる。
- 空間的局在化を向上させるために、拡張距離関数が導入され、特徴の信頼性が画像全体にわたって伝搬され、疑似マスクの品質が向上する。
- PACリファイナーモジュールを採用し、点ブロブからの距離に応じて特徴を精錬することで、セグメンテーション精度が向上する。
- すべてのモジュールが、別個の事前学習や精錬段階を経ることなく、ワンステージで統合的に学習可能であり、スクラッチからのエンドツーエンド学習が可能である。
- 事前学習バックボーンに依存しないように、点に基づく空間的ガイダンスに依存することで、任意のデータセットに適用可能である。
実験結果
リサーチクエスチョン
- RQ1事前学習バックボーンや多段階精錬に依存せず、ワンステージ弱教師付きセマンティックセグメンテーションが最先端性能を達成できるか?
- RQ2複雑な実世界シーンにおいて、点アノテーションは画像レベルアノテーションに比べて、正確な疑似マスク生成をどの程度向上させるか?
- RQ3標準的なCAMベース手法と比較して、拡張距離関数と点ブロブは、局在化およびセグメンテーション性能をどの程度向上させるか?
- RQ4事前学習モデルが失敗するか利用不可能なデータセットにおいて、点アノテーションのみを用いてスクラッチから学習した手法が、どの程度一般化可能か?
- RQ5オブジェクト数が多く、小規模なオブジェクトが多数存在するデータセットにおいて、画像レベルラベルベースの手法が困難となる状況で、本手法はどの程度の性能を示すか?
主な発見
- Pascal VOC 2012 において、本手法はテストセットで 72.1% の mIoU を達成し、事前学習バックボーンを用いない SOTA ワンステージ手法 [7] よりも 0.3% 高い性能を示した。
- CRAID データセットでは 72.1% の mIoU を達成し、同じ評価プロトコル下で SOTA ベースライン [7] の 54.9% に対して顕著に優れた性能を示した。
- CityPersons では 62.8% の mIoU を達成し、SOTA ベースライン [7] よりも 14.6 パーセンテージポイントも上回り、小オブジェクトが密集したシーンへの強力な一般化能力を示した。
- IAD では 72.4% の mIoU を達成し、再び [7] よりも 14.8 パーセンテージポイント高い性能を示し、実世界の複雑な状況でも有効であることを確認した。
- アブレーションスタディの結果、拡張距離関数、点ブロブ、PACリファイナーモジュールを併用した場合、60.7% の mIoU を達成し、最適な性能を得るにはすべてのモジュールが不可欠であることが確認された。
- 本手法は、ベンチマークデータセットおよび実世界データセットの両方で最先端性能を達成しており、かつスクラッチからの学習が可能であり、事前学習モデルへの依存を排除した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。