Skip to main content
QUICK REVIEW

[論文レビュー] Learning Depth via Leveraging Semantics: Self-supervised Monocular Depth Estimation with Both Implicit and Explicit Semantic Guidance

Rui Li, Xiantuo He|arXiv (Cornell University)|Feb 11, 2021
Advanced Vision and Imaging参考文献 46被引用数 9
ひとこと要約

本稿では、自己教師ありモノクローラル深度推定法を提案し、暗黙的および明示的な意味的ガイダンスを活用することで深度推定の精度を向上させる。意味的注意をもつ空間的特徴アライメント(SSFA)モジュールと意味的ガイダンス付き順序付け損失を導入することで、意味的注意特徴アライメントと頑健なエッジ注意監視を実現し、KITTIで0.103 AbsRelおよび4.471 RMSEを達成し、最先端の性能を実現した。

ABSTRACT

Self-supervised depth estimation has made a great success in learning depth from unlabeled image sequences. While the mappings between image and pixel-wise depth are well-studied in current methods, the correlation between image, depth and scene semantics, however, is less considered. This hinders the network to better understand the real geometry of the scene, since the contextual clues, contribute not only the latent representations of scene depth, but also the straight constraints for depth map. In this paper, we leverage the two benefits by proposing the implicit and explicit semantic guidance for accurate self-supervised depth estimation. We propose a Semantic-aware Spatial Feature Alignment (SSFA) scheme to effectively align implicit semantic features with depth features for scene-aware depth estimation. We also propose a semantic-guided ranking loss to explicitly constrain the estimated depth maps to be consistent with real scene contextual properties. Both semantic label noise and prediction uncertainty is considered to yield reliable depth supervisions. Extensive experimental results show that our method produces high quality depth maps which are consistently superior either on complex scenes or diverse semantic categories, and outperforms the state-of-the-art methods by a significant margin.

研究の動機と目的

  • 現在の自己教師あり深度推定手法がシーンの意味的情報を無視するという限界を是正し、複雑なまたはレアなオブジェクトカテゴリにおいて不正確な深度予測を回避すること。
  • 幾何的推論と文脈的一致性を向上させるために、意味的情報を暗黙的および明示的監視として統合することで深度推定を改善すること。
  • トレーニングおよびインフェレンス中にノイズが多いまたは不正確な意味的ラベルに起因する課題を克服し、現実世界のシナリオにおいても頑健性を確保すること。
  • カテゴリ固有の深度事前知識を活用することで、前景および背景の両方のオブジェクトカテゴリにわたる一貫性のある性能向上を達成すること。

提案手法

  • 同じ意味的カテゴリ内では一貫した深度分布を保ち、異なるカテゴリ間では分散を促進することで、深度特徴と意味的特徴をアライメントする意味的注意空間的特徴アライメント(SSFA)モジュールを導入する。
  • 意味的境界に基づいてクロスエッジ点の四重項をサンプリングする意味的ガイダンス付き順序付け損失を設計し、オブジェクト内では滑らかで、境界では鋭い深度変化を強制する。
  • 意味的ラベルのノイズと予測の不確実性に対応するための頑健なポイントペアサンプリング戦略を採用し、不確実性に応じた重み付けを用いてサンプリングの信頼性を向上させる。
  • 高品質な意味的アノテーションに依存するのを減らすために、完全セグメンテーションではなくバイナリ意味的マスクを入力として使用することで、ドメイン間での一般化性を向上させる。
  • 画像シーケンスを用いて自己教師ありで深度ネットワークをトレーニングし、特徴レベルおよび損失レベルで意味的監視を統合する。
  • 一般化性能を評価するため、Cityscapes や VOC からのクロスドメイン意味的ラベルを活用し、完全セグメンテーション mIoU が低くてもバイナリ mIoU が依然として高いことが示された。

実験結果

リサーチクエスチョン

  • RQ1特徴アライメントによる暗黙的意味的ガイダンスは、多様な意味的カテゴリを含む複雑なシーンにおける深度推定精度を向上させることができるか?
  • RQ2順序付け損失による明示的意味的監視は、カテゴリ固有の深度一貫性とオブジェクト境界での鋭い深度エッジを強制することで、深度マップ品質を向上させることができるか?
  • RQ3トレーニングおよびインフェレンス中にノイズが多いまたは不正確な意味的ラベルが与えられた場合、この手法はどの程度頑健か?
  • RQ4低品質またはクロスドメインの意味的ラベルを用いた場合、この手法はどの程度ドメイン間で一般化可能か?
  • RQ5暗黙的および明示的意味的ガイダンスを併用することで、背景およびレアオブジェクトクラスを含むすべての意味的カテゴリで一貫した性能向上が達成されるか?

主な発見

  • 提案手法はKITTIデータセットで0.103 AbsRelおよび4.471 RMSEを達成し、最先端の自己教師あり手法を大きく上回った。
  • 前景(例:人、交通標識)および背景(例:空、フェンス、壁)の両方のカテゴリにおいて、カテゴリ固有のAbsRelの改善が確認され、全カテゴリで深度推定が向上した。
  • 意味的ガイダンス付きサンプリング戦略は、真のクロス境界ポイントペアを特定する精度が75.2%に達し、直接的サンプリング法(55.3%)を19.9%上回った。
  • 誤った意味的ラベル(例:石を壁と誤認)や欠落ラベルが存在しても、正確な深度マップが生成されることから、頑健性が確認された。
  • クロスドメイン意味的ラベルに対してもモデルは良好に一般化した:完全セグメンテーション mIoU が低く(67.73 vs. 79.90)ても、バイナリ mIoU は高い水準(93.54% vs. 94.74%)を維持し、完全教師ありバージョンとほぼ同等の性能を示した。
  • SSFAモジュールは意味的文脈を効果的に活用し、バイナリマスクに直接含まれない領域においても深度推定を向上させた。これは、豊富な文脈的特徴学習が行われていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。