[論文レビュー] DESC: Domain Adaptation for Depth Estimation via Semantic Consistency
本稿では、モノクローラル深度推定のドメイン適応手法であるDESCを提案する。この手法は、セマンティック整合性とインスタンスレベルのサイズ事前知識を活用して、アノテーションのないターゲットドメインで仮ラベルを生成する。深度モデルとセマンティックおよびエッジ特徴に基づいて学習された補助モデルとの整合性を強制することで、Virtual KITTI から KITTI および Cityscapes から KITTI のベンチマークで最先端の性能を達成し、絶対相対誤差を最大9.8%まで低減する。
Accurate real depth annotations are difficult to acquire, needing the use of special devices such as a LiDAR sensor. Self-supervised methods try to overcome this problem by processing video or stereo sequences, which may not always be available. Instead, in this paper, we propose a domain adaptation approach to train a monocular depth estimation model using a fully-annotated source dataset and a non-annotated target dataset. We bridge the domain gap by leveraging semantic predictions and low-level edge features to provide guidance for the target domain. We enforce consistency between the main model and a second model trained with semantic segmentation and edge maps, and introduce priors in the form of instance heights. Our approach is evaluated on standard domain adaptation benchmarks for monocular depth estimation and show consistent improvement upon the state-of-the-art.
研究の動機と目的
- 正確な深度アノテーションを取得する課題に対処すること。これは高コストであり、LiDARなどの専用センサーを必要とする。
- ソースドメインからのセマンティックアノテーションを活用して、深度アノテーションが欠落しているターゲットドメインにおけるモノクローラル深度推定を改善すること。
- 合成(ソース)と実画像(ターゲット)のデータセット間のドメインギャップを、セマンティック整合性とインスタンスベースの深度事前知識を用いて埋めること。
- ターゲットドメインでステレオまたは動画の監視を必要とせずに、深度推定の性能を向上させること。
提案手法
- ターゲットドメインからのセマンティックおよびエッジ特徴を抽出するため、事前学習済みのパンセマティックセグメンテーションモデルを活用する。
- ソースドメインで学習されたインスタンスレベルのサイズ事前知識を用いて、ターゲットドメインで深度仮ラベルを生成する。
- 本質的な深度推定ネットワークと、セマンティックおよびエッジマップから深度を予測する補助ネットワークとの間の整合性損失を導入する。
- 整合性損失を適応的にスケーリングするための学習可能なスカラーを採用し、ドメインシフトにわたる一般化を向上させる。
- 自己教師付き深度損失とセマンティック整合性損失の組み合わせを用いて、主モデルを訓練する。
- 補助ネットワークをセマンティックおよびエッジ入力で学習させ、主モデルとの構造的整合性を強制する二本のブランチアーキテクチャを採用する。
実験結果
リサーチクエスチョン
- RQ1ソースドメインとターゲットドメインの間のセマンティック整合性が、ターゲット深度アノテーションが存在しないドメイン適応設定における深度推定を改善できるか?
- RQ2インスタンスレベルのサイズ事前知識を仮ラベルとして用いることで、ターゲットドメインにおける深度推定にどの程度効果があるか?
- RQ3セマンティックおよびエッジ特徴に基づいて学習されたモデルと深度モデルとの整合性を強制することで、ドメインシフトにわたる一般化が向上するか?
- RQ4提案手法は、既存のモノクローラル深度推定のドメイン適応手法をどの程度上回るか?
- RQ5ステレオや動画の追加監視を必要とせずに、Virtual KITTI から KITTI および Cityscapes から KITTI といった多様なデータセットに一般化可能か?
主な発見
- Virtual KITTI から KITTI ベンチマークにおいて、DESCは最先端手法と比較して9.8%低い絶対相対誤差(Sq Rel)を達成した。
- Cityscapes から KITTI ベンチマークでは、T 2 Netと比較して絶対相対誤差を13.9%低減し、優れたドメイン一般化性能を示した。
- セマンティックガイドドネットワークとの整合性項が、アブレーションスタディで顕著な性能向上に寄与していることが示された。
- 3フレームのリファインメントを用いるStruct2Depth (M+R) を上回ったが、推論には単一画像のみを必要とした。
- ImageNetの事前学習を必要としない状況でも最先端の結果を達成し、同じ設定でMonodepth2を上回った。
- 定性的な結果では、T 2 Net や GASDA と比較して、車両や電柱などのオブジェクトの幾何学的完全性が向上した予測深度マップが得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。