[論文レビュー] Weakly Supervised Semantic Segmentation by Pixel-to-Prototype Contrast
本稿では、画像分類と画素単位のセマンティックセグメンテーションの間の監督ギャップを狭めるために、ピクセルからプロトタイプへの対照的学習を用いた弱教師ありセマンティックセグメンテーション手法を提案する。プロトタイプに基づく対照的学習により、クロスビュー間の特徴一貫性とクラス内コンパクト性を強制することで、初期マスクの品質が向上し、ベースネットワークの変更や推論コストを追加せずにPASCAL VOC 2012でmIoUが最大6.13%向上する。
Though image-level weakly supervised semantic segmentation (WSSS) has achieved great progress with Class Activation Maps (CAMs) as the cornerstone, the large supervision gap between classification and segmentation still hampers the model to generate more complete and precise pseudo masks for segmentation. In this study, we propose weakly-supervised pixel-to-prototype contrast that can provide pixel-level supervisory signals to narrow the gap. Guided by two intuitive priors, our method is executed across different views and within per single view of an image, aiming to impose cross-view feature semantic consistency regularization and facilitate intra(inter)-class compactness(dispersion) of the feature space. Our method can be seamlessly incorporated into existing WSSS models without any changes to the base networks and does not incur any extra inference burden. Extensive experiments manifest that our method consistently improves two strong baselines by large margins, demonstrating the effectiveness. Specifically, built on top of SEAM, we improve the initial seed mIoU on PASCAL VOC 2012 from 55.4% to 61.5%. Moreover, armed with our method, we increase the segmentation mIoU of EPS from 70.8% to 73.6%, achieving new state-of-the-art.
研究の動機と目的
- 弱教師ありセマンティックセグメンテーション(WSSS)における画像レベル分類と画素レベルセグメンテーションの間の監督ギャップを解消すること。
- CAMに基づく初期疑似マスクの品質を向上させるために、ピクセルレベルの監督信号を導入すること。
- ベースネットワークの変更なしにSEAM や EPS といった強力なベースラインで一貫した性能向上を実現すること。
- ビュー間の特徴一貫性とクラス内コンパクト性を強制する対照的学習フレームワークの開発
提案手法
- 各ピクセルがその正例プロトタイプに引き寄せられ、負例から遠ざけられるよう、統一されたピクセルからプロトタイプへの対照的学習定式化を提案する。
- プロトタイプを各クラスの代表的埋め込みと定義し、CAMにおける上位活性化ピクセルから推定する。
- 同時にクロスビュー(cross-view)と各ビュー内(intra-view)で対照的学習を実行することで、特徴空間の一貫性とコンパクト性を正則化する。
- 過剰または不十分に活性化されたCAM領域からのノイズの多い対照を低減するため、準ハードプロトタイプマイニングとハードピクセルサンプリングを導入する。
- 軽量なプロジェクタを介して既存のWSSSフレームワークに統合し、ベースネットワークの変更が不要で、追加の推論コストも発生しない。
- 空間変換(リスケーリング、フリップ、回転、トランスレーション)を用いて複数のビューを生成し、クロスビュー対照を実現する。
実験結果
リサーチクエスチョン
- RQ1ピクセルからプロトタイプへの対照的学習は、画像レベルWSSSにおける監督ギャップを効果的に狭めることができるか?
- RQ2クロスビューとインラインビューの両方の対照的学習が、どのように疑似マスク品質とセグメンテーション性能を向上させるか?
- RQ3本手法は、アーキテクチャの変更なしに、SEAM や EPS といった最先端のWSSSモデルをどの程度向上させられるか?
- RQ4プロトタイプ数(K)のハイパーパrameter選択に対して、本手法はどの程度頑健か?
主な発見
- SEAM に本手法を適用した結果、PASCAL VOC 2012 における初期マスクのmIoUが55.4%から61.5%に向上し、6.13%の向上を達成した。
- EPS に適用した場合、セグメンテーションmIoUが70.8%から73.6%に上昇し、新たな最先端性能を達成した。
- アブレーションスタディの結果、クロスプロトタイプ対照、クロスCAM対照、インラインビュー対照、プロトタイプマイニング、ハードピクセルサンプリングの各要素が、性能向上に顕著な寄与をしていることが確認された。
- Kの選択に対して本手法は頑健であり、最適な性能はK=32で得られ、トレーニングセットで61.54%のmIoUを達成した。
- 複数の空間変換(リスケーリング、フリップ、回転、トランスレーション)を組み合わせることでわずかな向上が得られ、すべての変換を適用した際が最良で61.63%のmIoUを記録した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。