Skip to main content
QUICK REVIEW

[論文レビュー] SC-DepthV3: Robust Self-supervised Monocular Depth Estimation for Dynamic Scenes

Libo Sun, Jia-Wang Bian|arXiv (Cornell University)|Nov 7, 2022
Advanced Vision and Imaging被引用数 4
ひとこと要約

SC-DepthV3 は、事前学習済みの単眼深度モデルから得られる疑似深度を活用することで、動的シーンにおける頑健な自己教師あり単眼深度推定手法を提案する。動的領域の再定義(DRR)と局所構造の再定義(LSR)モジュールを導入し、深度順序の一貫性と法線を用いたランク付けを活用することで、物体の境界における精度とシャープネスを向上させ、6つのベンチマークデータセット(動的シーンを含む)において、先行する自己教師あり手法を顕著に上回る性能を達成した。

ABSTRACT

Self-supervised monocular depth estimation has shown impressive results in static scenes. It relies on the multi-view consistency assumption for training networks, however, that is violated in dynamic object regions and occlusions. Consequently, existing methods show poor accuracy in dynamic scenes, and the estimated depth map is blurred at object boundaries because they are usually occluded in other training views. In this paper, we propose SC-DepthV3 for addressing the challenges. Specifically, we introduce an external pretrained monocular depth estimation model for generating single-image depth prior, namely pseudo-depth, based on which we propose novel losses to boost self-supervised training. As a result, our model can predict sharp and accurate depth maps, even when training from monocular videos of highly-dynamic scenes. We demonstrate the significantly superior performance of our method over previous methods on six challenging datasets, and we provide detailed ablation studies for the proposed terms. Source code and data will be released at https://github.com/JiawangBian/sc_depth_pl

研究の動機と目的

  • 動的物体や隠蔽が動画学習中に生じる自己教師あり単眼深度推定の性能低下を是正すること。
  • 隠蔽によりマルチビュー一貫性が失敗する物体境界における深度マップのシャープネスを向上させること。
  • 教師なしラベルを必要とせず、事前学習済みモデルから得られる不完全ではあるが順序的に正確な疑似深度を活用して自己教師あり学習をガイドすること。
  • 明示的な動的物体検出や複雑な運動モデリングを必要とせず、動的領域でも高い性能を維持する手法を開発すること。
  • 市販の疑似深度を最小限の追加コストで効果的に活用し、自己教師あり深度推定を向上させられることを実証すること。

提案手法

  • 事前学習済みの単眼深度モデル(LeReS)を用いて、自己教師あり学習のための単眼深度事前知識として疑似深度を生成する。
  • 動的領域再定義(DRR)を導入し、信頼度に応じたサンプリングと深度ランク損失を用いて、動的領域と静的領域間の深度順序の一貫性を強制する。
  • 法線マッチング損失とエッジをガイドとする相対法線ランク損失を用いて、局所幾何構造を保持する局所構造再定義(LSR)を提案する。
  • 新たな疑似深度に基づく正則化と光度的・幾何的一致損失を組み合わせることで、学習の安定性と精度を向上させる。
  • 疑似深度の監視を統合しつつ自己教師あり目的を維持するマルチステージ学習戦略を採用する。
  • 外部モデルの再学習や微調整を回避し、市販の疑似深度推論を用いることで、計算コストを最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの単眼深度モデルから得られる疑似深度は、動的シーンにおける自己教師あり深度推定を向上させることができるか?
  • RQ2定量的精度が低いが不完全な疑似深度でさえ、自己教師あり深度学習の向上に効果的に利用可能か?
  • RQ3動的領域と静的領域間の深度順序の一貫性を活用することで、一般化性能と境界のシャープネスが向上するか?
  • RQ4エッジをガイドとする損失を用いて法線情報を統合することで、深度マップにおける局所構造の保持が向上するか?
  • RQ5提案手法は、静的および極めて動的であるとされるベンチマークデータセットにおいて、最先端の自己教師あり手法を上回る性能を示せるか?

主な発見

  • SC-DepthV3 は、DDAD や IBims-1 といった動的ベンチマークを含む6つの挑戦的データセットで最先端の性能を達成し、LeReS(ResNet-101) を用いた疑似深度で DDAD において 0.142 の AbsRel を達成した。
  • 消去実験により、DRR または LSR モジュールを削除すると顕著な性能低下が生じ、それらの有効性が裏付けられた。
  • 定性的な結果(図1および図5(d))から、特に動的領域および物体境界において、先行する自己教師あり手法を大きく上回っていることが示された。
  • LeReS(ResNet-101) を用いた疑似深度生成が、DPT や LeReS(ResNet-50) よりも優れた結果をもたらした。これは、法線情報の整合性の重要性を示している。
  • 性能向上は動的シーンおよび静的シーンの両方で一貫しており、シーンの複雑さに対して頑健であることが示された。
  • 定量的精度が低い疑似深度でさえ、本手法により高精度な深度推定が達成された。これは、順序的一致性が有効な監視に十分であることを証明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。