Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adaptive Semantic Segmentation with Self-Supervised Depth Estimation

Qin Wang, Dengxin Dai|arXiv (Cornell University)|Apr 28, 2021
Domain Adaptation and Few-Shot Learning参考文献 58被引用数 6
ひとこと要約

本稿では、自己教師付き深度推定をソースドメインおよびターゲットドメインの両方で活用してドメインシフトを緩和する、セマンティックセグメンテーションのための新しい教師なしドメイン適応フレームワーク、相関認識ドメイン適応(CorDA)を提案する。セマンティクスと深度の間のタスク特徴相関を明示的にモデル化し、深度予測の乖離を用いてターゲットの疑似ラベルを精緻化することで、CorDAはSYNTHIA-to-Cityscapesで55.0% mIoU、GTA-to-Cityscapesで56.6% mIoUの最先端性能を達成した。

ABSTRACT

Domain adaptation for semantic segmentation aims to improve the model performance in the presence of a distribution shift between source and target domain. Leveraging the supervision from auxiliary tasks~(such as depth estimation) has the potential to heal this shift because many visual tasks are closely related to each other. However, such a supervision is not always available. In this work, we leverage the guidance from self-supervised depth estimation, which is available on both domains, to bridge the domain gap. On the one hand, we propose to explicitly learn the task feature correlation to strengthen the target semantic predictions with the help of target depth estimation. On the other hand, we use the depth prediction discrepancy from source and target depth decoders to approximate the pixel-wise adaptation difficulty. The adaptation difficulty, inferred from depth, is then used to refine the target semantic segmentation pseudo-labels. The proposed method can be easily implemented into existing segmentation frameworks. We demonstrate the effectiveness of our approach on the benchmark tasks SYNTHIA-to-Cityscapes and GTA-to-Cityscapes, on which we achieve the new state-of-the-art performance of $55.0\%$ and $56.6\%$, respectively. Our code is available at \url{https://qin.ee/corda}.

研究の動機と目的

  • 外観、照明、視点の違いによりソースドメインとターゲットドメインが異なるセマンティックセグメンテーションにおけるドメインシフトを解消すること。
  • 従来の手法がソースドメインでの真値深度に依存するという制限を克服し、両ドメインで利用可能な自己教師付き深度推定を活用すること。
  • ドメイン間で不変なセマンティクスと深度特徴の相関を活用することで、ターゲットドメインのセグメンテーション性能を向上させること。
  • ドメイン固有の深度デコーダー間の深度予測乖離を用いて、適応の難易度を推定し、その結果を基にターゲットのセマンティックセグメンテーション疑似ラベルの信頼度を再重み付けまたは精緻化すること。
  • 実用的導入を想定し、既存のUDAセグメンテーションアーキテクチャと互換性を持つプラグアンドプレイフレームワークを構築すること。

提案手法

  • 両ドメインのステレオペアまたは動画シーケンスを用いて自己教師付き深度推定器を学習させ、疑似深度の監督信号を生成する。
  • ドメイン間でセマンティクスと深度特徴のタスク特徴相関を明示的に学習・転送するためのドメイン共有のマルチモーダル distillation モジュールを導入する。
  • 同じターゲット画像に対してドメイン固有の深度デコーダーを用いて深度を予測し、それらの予測の乖離を適応の難易度の近似として計算する。
  • 推定された適応の難易度を用いて、自己学習中のターゲットのセマンティックセグメンテーション疑似ラベルの信頼度を再重み付けまたは精緻化する。
  • 敵対的学習部品を含まない標準的な自己学習UDAパイプラインに、相関学習および疑似ラベル精緻化モジュールを統合する。
  • エンコーダデコーダアーキテクチャに容易に挿入可能な軽量で微分可能モジュールを用いることで、既存のセグメンテーションフレームワークとの互換性を確保する。

実験結果

リサーチクエスチョン

  • RQ1真値深度を必要とせず、ステレオまたは動画シーケンスからの自己教師付き深度推定がドメインシフトを効果的に軽減できるか?
  • RQ2セマンティクスと深度特徴の相関をドメイン間で明示的にモデル化・転送することで、セグメンテーションの一般化性能が向上するか?
  • RQ32つのドメイン固有のデコーダーからの深度予測の乖離が、ターゲットドメインにおける適応の難易度の信頼できる代理指標として機能するか?
  • RQ4深度に基づく適応の難易度を用いてターゲット疑似ラベルを精緻化することで、標準的な自己学習ベースラインに比べてセグメンテーション精度が向上するか?
  • RQ5提案手法はSYNTHIA-to-CityscapesやGTA-to-Cityscapesのような多様なドメイン適応ベンチマークで最先端性能を達成できるか?

主な発見

  • CorDAはSYNTHIA-to-Cityscapesベンチマークで55.0% mIoUという新たな最先端性能を達成し、以前のSOTA手法DACSを6.7ポイント上回った。
  • GTA-to-Cityscapesベンチマークでは56.6% mIoUを達成し、DACSよりも4.5%の絶対的向上を示し、他の深度拡張手法よりも顕著な優位性を示した。
  • ImageNetのみの事前学習重みを用いても効果的であることが確認され、SYNTHIA-to-Cityscapesで54.6% mIoU、GTA-to-Cityscapesで56.4% mIoUを達成した。これは事前学習選択に対するロバストネスを示している。
  • 定性的な結果から、歩道や道路など曖昧なクラスにおいて顕著な改善が見られ、識別が難しいセマンティック領域への一般化性能の向上が示された。
  • アブレーションスタディにより、明示的な相関学習と深度に基づく疑似ラベル精緻化の両方のコンponentが性能向上に顕著な寄与をしていることが確認された。
  • モノクローラルおよびステレオ深度推定の両方のモダリティで一貫した性能向上を示し、深度推定のモダリティに依存しない堅牢性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。