Skip to main content
QUICK REVIEW

[論文レビュー] Context-Aware Mixup for Domain Adaptive Semantic Segmentation

Qianyu Zhou, Zhengyang Feng|arXiv (Cornell University)|Aug 8, 2021
Domain Adaptation and Few-Shot Learning参考文献 68被引用数 13
ひとこと要約

本論文は、学習された文脈マスクと有意性再重み付けされた一致損失を通じて、クロスドメインの文脈的依存関係を明示的に活用する、セマンティックセグメンテーションのための新しいドメイン適応フレームワーク、Context-Aware Mixup (CAMix) を提案する。入力、出力、有意性マスクの各レベルでミックスアップを誘導することにより、一般化性能を向上させ、負の転送を軽減し、GTA5→Cityscapes および SYNTHIA→Cityscapes ベンチマークで、それぞれ最大 3.1% および 2.8% の mIoU の向上を達成し、最先端の性能を実現した。

ABSTRACT

Unsupervised domain adaptation (UDA) aims to adapt a model of the labeled source domain to an unlabeled target domain. Existing UDA-based semantic segmentation approaches always reduce the domain shifts in pixel level, feature level, and output level. However, almost all of them largely neglect the contextual dependency, which is generally shared across different domains, leading to less-desired performance. In this paper, we propose a novel Context-Aware Mixup (CAMix) framework for domain adaptive semantic segmentation, which exploits this important clue of context-dependency as explicit prior knowledge in a fully end-to-end trainable manner for enhancing the adaptability toward the target domain. Firstly, we present a contextual mask generation strategy by leveraging the accumulated spatial distributions and prior contextual relationships. The generated contextual mask is critical in this work and will guide the context-aware domain mixup on three different levels. Besides, provided the context knowledge, we introduce a significance-reweighted consistency loss to penalize the inconsistency between the mixed student prediction and the mixed teacher prediction, which alleviates the negative transfer of the adaptation, e.g., early performance degradation. Extensive experiments and analysis demonstrate the effectiveness of our method against the state-of-the-art approaches on widely-used UDA benchmarks.

研究の動機と目的

  • 既存の教師なしドメイン適応(UDA)手法が、ドメイン間で共有される文脈的依存関係をほとんど無視しているという限界に対処すること。
  • 適応の過程で、ドメイン間の文脈を明示的にモデル化・転送することで、ドメインシフトを低減すること。
  • 特に初期学習段階において顕著な負の転送や訓練の不安定性を軽減すること。
  • 長尾分布やレアカテゴリのターゲットドメインにおける性能を向上させる、完全にエンドツーエンドで訓練可能なフレームワークを開発すること。
  • ドメイン適応セマンティックセグメンテーションにおいて、複雑な敵対的または自己学習パイプラインに代わる、単純だが効果的な代替手法を提供すること。

提案手法

  • 空間的分布と事前文脈的関係を活用して、ドメインミックスアップを誘導するマスクを生成する文脈的マスク生成(CMG)戦略を提案する。
  • 生成された文脈マスクを用いて、入力レベル(画像の混合)、出力レベル(疑似ラベルの混合)、有意性マスクレベル(信頼度を考慮した混合)の3段階でミックスアップを適用する。
  • 予測の信頼度に基づく重みを用いて、混合された学生モデルと教師モデルの予測の不一致をペナルティ化する、有意性再重み付けされた一貫性損失(SRC)を導入する。
  • ハイパーパramータ β と γ によって制御される動的しきい値機構を用いて、訓練中に一貫性損失を適応的に調整する。
  • 教師-学生フレームワークと一貫性正則化を組み合わせ、教師モデルが学生モデルのための疑似ラベルを提供し、入力および出力の両方にミックスアップを適用する。
  • このフレームワーク全体はエンドツーエンドで訓練可能であり、文脈モデリング、ミックスアップ、一貫性正則化の共同最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1クロスドメインの文脈的依存関係を明示的にモデル化することで、セマンティックセグメンテーションにおけるドメイン適応性能が向上するか?
  • RQ2ドメインミックスアップにおいて、文脈的関係を効果的に符号化・利用する方法は何か? これにより、文脈に反するデータ拡張を防げるか?
  • RQ3文脈に配慮した一貫性正則化を組み込むことで、UDAにおける訓練の不安定性や初期段階での性能低下が軽減されるか?
  • RQ4提案手法は、ターゲットドメインにおけるレアまたは長尾カテゴリの性能をどの程度向上させるか?
  • RQ5単純でエンドツーエンドで訓練可能なフレームワークは、複雑なマルチステージの敵対的または自己学習アプローチを凌駆することができるか?

主な発見

  • CAMix は、GTA5→Cityscapes および SYNTHIA→Cityscapes ベンチマークで最先端の性能を達成し、SOTAベースライン iDACS に対して、それぞれ最大 3.1% および 2.8% の mIoU の向上を実現した。
  • 特に 'traffic sign' や 'rider' のような頻度の低いカテゴリについて、より良い一般化性能と過学習の低減により、クラスごとの IoU が顕著に向上した。
  • 有意性再重み付けされた一貫性損失(SRC)は、訓練の不安定性を効果的に緩和し、性能曲線から示される初期段階の性能低下を防止した。
  • ハイパーパramータの分析から、最適な性能は β=0.75 および γ=-5 の組み合わせで達成され、異なるデータセットや設定においても安定性を示した。
  • 定性的な結果から、CAMix は特に 'road'、'sidewalk'、'truck' のような複雑で大規模なカテゴリにおいて、より信頼性が高く正確な予測を生成することがわかった。
  • 文脈マスク生成戦略は、物体レベルの文脈を効果的に保持しており、歩行者が車の上にいる、建物の上を空が通るといった非現実的なミックスアップを回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。