[論文レビュー] PCAMs: Weakly Supervised Semantic Segmentation Using Point Supervision
本論文では、画像レベルのアノテーションに代わる実用的な代替手段として点レベルのアノテーションのみを用いて弱教師付きセマンティックセグメンテーションを実現する新しい手法PCAMsを提案する。点のラベルによるクラス活性化マップ(CAM)の訓練と、IRNetによるマップの精錬を通じて、擬似セグメンテーションラベルを生成する。このアプローチは、PASCAL VOC 2012で最先端の性能を達成しており、ボックスやスクラッチなどのより強い監視を用いる手法を上回っている。
Current state of the art methods for generating semantic segmentation rely heavily on a large set of images that have each pixel labeled with a class of interest label or background. Coming up with such labels, especially in domains that require an expert to do annotations, comes at a heavy cost in time and money. Several methods have shown that we can learn semantic segmentation from less expensive image-level labels, but the effectiveness of point level labels, a healthy compromise between all pixels labelled and none, still remains largely unexplored. This paper presents a novel procedure for producing semantic segmentation from images given some point level annotations. This method includes point annotations in the training of a convolutional neural network (CNN) for producing improved localization and class activation maps. Then, we use another CNN for predicting semantic affinities in order to propagate rough class labels and create pseudo semantic segmentation labels. Finally, we propose training a CNN that is normally fully supervised using our pseudo labels in place of ground truth labels, which further improves performance and simplifies the inference process by requiring just one CNN during inference rather than two. Our method achieves state of the art results for point supervised semantic segmentation on the PASCAL VOC 2012 dataset \cite{everingham2010pascal}, even outperforming state of the art methods for stronger bounding box and squiggle supervision.
研究の動機と目的
- セマンティックセグメンテーションにおけるピクセルレベルのアノテーションの高コストを低減するため、実用的代替手段として点レベルの監視を活用すること。
- クラス活性化マップの学習に点アノテーションを統合することで、弱教師付きセマンティックセグメンテーションの局所化精度を向上させること。
- 疎で低コストな点アノテーションのみを用いて、完全に教師ありモデルに近い性能を達成する手法を開発すること。
- 点監視による活性化マップから生成された擬似ラベルを用いて、1つの完全に教師ありネットワークを訓練することで推論を簡素化すること。
提案手法
- 各点のクラスラベルが特徴マップ内の局所化をガイドするように、点監視によるCNNを訓練し、ポイント対比活性化マップ(PCAMs)を生成する。
- IRNetを用いて、遷移行列による意味的類似性をモデル化することでPCAMsを精錬し、空間的位置間でラベルを伝搬する。
- 精錬されたPCAMsをしきい値処理および後処理することで、擬似セマンティックセグメンテーションラベルを生成する。
- 擬似ラベルを真のラベルとして用い、完全に教師ありのセマンティックセグメンテーションネットワーク(例:DeepLabv3+)を訓練し、1つのネットワークでエンドツーエンドの推論を可能にする。
- 特徴抽出にResNet-50バックボーンを活用し、学習率、重み減衰、最適化手法の設定を含む標準的な訓練プロトコルを採用する。
- 最終畳み込み層からの最終的なヒートマップを生成するために、アップサンプリングとクラス依存の重みベクトル統合を適用する。
実験結果
リサーチクエスチョン
- RQ1画像レベルの監視と比較して、点監視が弱教師付きセマンティックセグメンテーションにおける局所化を顕著に改善できるか?
- RQ2点レベルのアノテーションをクラス活性化マップの学習に統合することは、より良い特徴局所化を実現するのにどの程度有効か?
- RQ3精錬されたPCAMsは、完全に教師ありネットワークが最先端の性能を達成できる高品質な擬似セグメンテーションラベルを生成できるか?
- RQ4本手法は、ボックスやスクラッチなどのより強い監視を用いる既存の手法を上回るか?
主な発見
- PCAMsはPASCAL VOC 2012の検証セットで87.1%の平均交差率(mIOU)を達成し、点監視下での以前の最先端手法を上回った。
- 本手法は、スクラッチ監視を用いる最先端手法(Tang et al., 2021)を上回り、最近のボックス監視手法(Song et al., 2022)でさえも上回った。
- 精錬後のPCAMsは、標準CAMと比較して11.1%の性能向上を達成したのに対し、精錬前の性能向上は8.4%であった。
- 擬似ラベルを用いて訓練された最終モデルは、完全に教師ありモデルの89.9%の性能を達成しており、最小限の監視からの強力な一般化能力を示した。
- 定量的比較では、誤検出を低減し、境界適合性を向上させたことが確認され、完全に教師ありモデルとの定性的比較でも顕著であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。