[論文レビュー] SePiCo: Semantic-Guided Pixel Contrast for Domain Adaptive Semantic Segmentation
SePiCoは、カテゴリ重心と分布に敏感なプロトタイプを用いて、意味的ガイド付きピクセル対比を通じて自己学習を強化することで、ドメイン間で判別性が高くクラスバランスの取れた表現を学習する、ワンステージのドメイン適応的セマンティックセグメンテーションフレームワークを提案する。閉形式の対比損失により無限の(非)類似ピクセルペアを暗黙的にモデル化することで、一般化性能と学習安定性が著しく向上し、合成データから実画像、昼間から夜間へのベンチマークで最先端の性能を達成する。
Domain adaptive semantic segmentation attempts to make satisfactory dense predictions on an unlabeled target domain by utilizing the supervised model trained on a labeled source domain. In this work, we propose Semantic-Guided Pixel Contrast (SePiCo), a novel one-stage adaptation framework that highlights the semantic concepts of individual pixels to promote learning of class-discriminative and class-balanced pixel representations across domains, eventually boosting the performance of self-training methods. Specifically, to explore proper semantic concepts, we first investigate a centroid-aware pixel contrast that employs the category centroids of the entire source domain or a single source image to guide the learning of discriminative features. Considering the possible lack of category diversity in semantic concepts, we then blaze a trail of distributional perspective to involve a sufficient quantity of instances, namely distribution-aware pixel contrast, in which we approximate the true distribution of each semantic category from the statistics of labeled source data. Moreover, such an optimization objective can derive a closed-form upper bound by implicitly involving an infinite number of (dis)similar pairs, making it computationally efficient. Extensive experiments show that SePiCo not only helps stabilize training but also yields discriminative representations, making significant progress on both synthetic-to-real and daytime-to-nighttime adaptation scenarios.
研究の動機と目的
- 既存のドメイン適応手法が、無視されたクラス内compactnessとクラス間分散を理由に、クロスドメインのセマンティック変化に対処できず、特徴の判別性が低いという限界を是正すること。
- ドメイン間のピクセル間の意味的関係を明示的にモデル化することで、ドメイン適応的セマンティックセグメンテーションにおける自己学習を向上させること。
- 段階的学習や複雑な初期化に依存せずに、構造的でクラス判別性が高くバランスの取れたピクセル表現を学習すること。
- 閉形式の上界を用いて無限の(非)類似ピクセルペアを暗黙的に含む、計算効率の良い対比損失を開発すること。
提案手法
- 全ソースドメインからのグローバルカテゴリプロトタイプと、メモリバンクに格納された画像ごとのローカルカテゴリ重心を用いた、重心に敏感なピクセル対比を導入する。
- ラベル付きソースデータからの各セマンティックカテゴリの包括的分布をモデル化することで、意味的整合性をガイドする、分布に敏感なピクセル対比を提案する。
- 分布に敏感な対比損失の閉形式上界を導出し、明示的なネガティブペアのサンプリングなしで効率的な最適化を可能にする。
- 教師-生徒フレームワークにおいて、軽量なプロジェクションヘッドを用いて新しいピクセル埋め込み空間を生成する。両モデルがソースおよびターゲット画像を処理する。
- 明示的なネガティブペアのサンプリングなしで、ステージごとの学習に起因する誤差拡大を回避するワンステージの自己学習パイプラインに対比損失を統合する。
- 信頼度推定と一貫性正則化を用いて、学習中に疑似ラベルを精緻化し、ノイズの多い予測に対するロバスト性を向上させる。
実験結果
リサーチクエスチョン
- RQ1意味的ガイド付きピクセル対比は、ドメイン適応的セマンティックセグメンテーションにおける特徴の判別性と一般化性能を向上させ得るか?
- RQ2グローバルおよびローカルカテゴリプロトタイプの統合は、ドメイン間でクラスバランスの取れた表現を学習する上でどのように影響を与えるか?
- RQ3明示的なネガティブサンプリングがなくとも、セマンティックカテゴリの真の分布をモデル化することで、対比学習の安定性と有効性が向上するか?
- RQ4意味的ガイド付き対比を用いたワンステージ自己学習フレームワークは、精度と学習効率の両面で段階的学習手法を上回るか?
- RQ5提案手法は、合成データから実画像、昼間から夜間への多様なドメインシフトのシナリオに、どの程度一般化可能か?
主な発見
- SePiCoはDeepLab-V2を用いてGTAV-to-Cityscapesベンチマークで61.0 mIoUを達成し、Source Only(38.6 mIoU)とDACS(52.1 mIoU)を著しく上回る。
- SegFormer-Mit-B5を用いたより挑戦的なDAFormerベースの設定では、SePiCoは70.3 mIoUを達成し、DAFormer(68.3 mIoU)とSource Only(44.5 mIoU)を上回る。
- LogMEで測定したモデルの転送可能性は、CAG-UDAとProDAを上回り、全学習段階で強い一般化能力を示す。
- スループット分析から、SePiCoはSegFormer-Mit-B5を用いても1イテレーションあたり1.45秒のわずかな計算オーバーヘッドを追加する一方で、優れた性能を発揮しており、DAFormer(1.33秒)と比較しても差は小さい。
- アブレーションスタディにより、重心に敏感な対比と分布に敏感な対比の両成分が性能向上に顕著に寄与しており、特に分布に敏感な対比が最大の貢献を示す。
- 対比損失の閉形式上界により、明示的なネガティブマイニングや大容量メモリの必要性なしに、安定した学習と効率的な最適化が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。