[論文レビュー] CLUDA : Contrastive Learning in Unsupervised Domain Adaptation for Semantic Segmentation
CLUDAは、教師-生徒フレームワークからのマルチレベル統合特徴にコントラスト学習損失を適用することで、教師ありのアノテーションを一切使用せずに、合成データ(ソース)と現実世界データ(ターゲット)の両ドメインにおける特徴の凝集性と分離性を向上させる、コントラスト学習に基づく自己教師型ドメイン適応手法を提案する。最小限のアーキテクチャ変更と低メモリオーバーヘッドで、74.4 mIoU(GTA→Cityscapes、+0.6)および66.8 mIoU(Synthia→Cityscapes、+1.0)という最先端の性能を達成する。
In this work, we propose CLUDA, a simple, yet novel method for performing unsupervised domain adaptation (UDA) for semantic segmentation by incorporating contrastive losses into a student-teacher learning paradigm, that makes use of pseudo-labels generated from the target domain by the teacher network. More specifically, we extract a multi-level fused-feature map from the encoder, and apply contrastive loss across different classes and different domains, via source-target mixing of images. We consistently improve performance on various feature encoder architectures and for different domain adaptation datasets in semantic segmentation. Furthermore, we introduce a learned-weighted contrastive loss to improve upon on a state-of-the-art multi-resolution training approach in UDA. We produce state-of-the-art results on GTA $ ightarrow$ Cityscapes (74.4 mIOU, +0.6) and Synthia $ ightarrow$ Cityscapes (67.2 mIOU, +1.4) datasets. CLUDA effectively demonstrates contrastive learning in UDA as a generic method, which can be easily integrated into any existing UDA for semantic segmentation tasks. Please refer to the supplementary material for the details on implementation.
研究の動機と目的
- 合成データから現実世界データへの転移において生じるドメインシフトを解消すること。
- 自己教師型設定下でコントラスト学習を用いて、ドメイン間の特徴の凝集性と分離性を向上させること。
- 既存のUDAフレームワーク(例:DAFormer や HRDA)と互換性を持つ汎用的かつプラグイン型の手法を開発すること。
- ビジョントランスフォーマーベースのモデルにおける形状バイアスを軽減するため、'stuff' および 'thing' クラスに別々にコントラスト学習損失を適用すること。
- 異なる特徴スケールからのコントラスト学習損失の重み付けを学習することで、マルチスケール学習を最適化すること。
提案手法
- 教師がターゲットドメインの画像に対して疑似ラベルを生成する生徒-教師トレーニングの枠組みを導入する。
- エンコーダーから得られるマルチレベル統合特徴にコントラスト学習損失を適用し、ソース-ターゲット混合画像を用いてドメイン間の特徴をアライメントする。
- 'stuff' および 'thing' クラスに別々にコントラスト学習損失を適用することで、トランスフォーマーベースのモデルにおける形状バイアスを低減する。
- 信頼度重み付きコントラスト学習損失を採用し、教師の予測信頼度に応じて損失の寄与度をスケーリングすることで、初期トレーニング段階の安定性を向上させる。
- 低解像度および高解像度特徴マップからのコントラスト学習損失を、学習可能な重み付けで統合することで、マルチスケール適応を改善する。
- 交差エントロピー損失と統合されたトレーニング目的関数としてコントラスト学習損失を統合し、特徴学習の向上を図る。
実験結果
リサーチクエスチョン
- RQ1ターゲットアノテーションを一切必要としない状況下で、コントラスト学習がドメイン一般化性能を向上させ得るか?
- RQ2'stuff' および 'thing' クラスに別々にコントラスト学習を適用することで、ビジョントランスフォーマーベースのバックボーンにおける性能にどのような影響を与えるか?
- RQ3異なる特徴スケールからのコントラスト学習損失の学習可能な重み付けが、マルチスケールドメイン適応を改善するか?
- RQ4コントラスト学習をDAFormer や HRDA などの既存の最先端UDAフレームワークに効果的に統合できるか?
- RQ5信頼度に基づく重み付けによるコントラスト学習損失は、初期トレーニング段階における訓練の安定性と最終的なmIoUを向上させるか?
主な発見
- GTA→Cityscapesにおいて、CLUDAは74.4 mIoUを達成し、前回の最先端性能比で+0.6の向上を示し、標準偏差は0.32であった。
- Synthia→Cityscapesにおいて、CLUDAは66.8 mIoUを達成し、前回の最先端性能比で+1.0の向上を示し、標準偏差は0.44であった。
- Swin-Lなどの複数のバックボーンアーキテクチャに適用しても、常に性能が向上し、DAFormer や HRDA への統合が有効であることが確認された。
- 'stuff' および 'thing' クラスに別々にコントラスト学習を適用することで、特に看板や信号といった曖昧なクラス間の誤分類が顕著に減少した。
- 低解像度および高解像度からのコントラスト学習損失の学習可能な重み付けは、固定値または単純平均化戦略よりも優れた性能を示した。
- 信頼度重み付きコントラスト学習損失は、訓練の安定性と最終的な性能を顕著に向上させ、これを省略した場合にmIoUが著しく低下する傾向を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。