Skip to main content
QUICK REVIEW

[論文レビュー] DiPE: Deeper into Photometric Errors for Unsupervised Learning of Depth and Ego-motion from Monocular Videos

Hualie Jiang, Laiyan Ding|arXiv (Cornell University)|Mar 3, 2020
Advanced Vision and Imaging参考文献 36被引用数 6
ひとこと要約

本稿では、不確実なピクセルや非定常ピクセルからの光度誤差を抑制するためのアウ tiers マスク技術を導入することで、遮蔽やシーンの動的要因に対する耐性を向上させた、新しい教師なし単眼深度および自己運動推定フレームワークであるDiPEを提案する。また、深度マップのアーティファクトを低減するための効率的な重み付きマルチスケール方式を採用している。本手法は、深度推定および自己運動推定の両面でKITTIベンチマークで最先端の性能を達成した。

ABSTRACT

Unsupervised learning of depth and ego-motion from unlabelled monocular videos has recently drawn great attention, which avoids the use of expensive ground truth in the supervised one. It achieves this by using the photometric errors between the target view and the synthesized views from its adjacent source views as the loss. Despite significant progress, the learning still suffers from occlusion and scene dynamics. This paper shows that carefully manipulating photometric errors can tackle these difficulties better. The primary improvement is achieved by a statistical technique that can mask out the invisible or nonstationary pixels in the photometric error map and thus prevents misleading the networks. With this outlier masking approach, the depth of objects moving in the opposite direction to the camera can be estimated more accurately. To the best of our knowledge, such scenarios have not been seriously considered in the previous works, even though they pose a higher risk in applications like autonomous driving. We also propose an efficient weighted multi-scale scheme to reduce the artifacts in the predicted depth maps. Extensive experiments on the KITTI dataset show the effectiveness of the proposed approaches. The overall system achieves state-of-theart performance on both depth and ego-motion estimation.

研究の動機と目的

  • 教師なし単眼深度学習における反対方向に動く物体の正確な深度推定の課題に取り組むこと。
  • 教師なし深度推定におけるマルチスケール学習に起因する深度マップのアーティファクトを低減すること。
  • 光度誤差の監視を精緻化することで、遮蔽およびシーンの動的要因に対する耐性を向上させること。
  • 複雑なモジュールを追加せずに、性能を向上させるシンプルで効果的なフレームワークを開発すること。
  • 深度および自己運動推定の両方において、KITTIデータセットで最先端の性能を達成すること。

提案手法

  • 誤差の大きさの統計的分析を用いて、遮蔽または非定常ピクセルからの光度誤差を特定・抑制するためのアウ tiers マスク技術を導入する。
  • 誤差マップにアウ tiers マスクを適用し、バックプロパゲーションの前に適用することで、動的または見えない領域からの誤った勾配を防ぐ。
  • マルチスケールの監視信号に適応的な重みを割り当てることで、深度予測におけるアーティファクトを低減する重み付きマルチスケール方式を提案する。
  • 深度推定には標準のU-Netを、自己運動推定にはCNNを用い、可微分な画像ワープを用いて、元の視点からターゲット視点を合成する。
  • 標準の教師なし学習フレームワーク内に、アウ tiers マスクと重み付きマルチスケール方式を統合し、光度一貫性損失を監視信号として使用する。
  • 既存のマスク技術(原理的、自動マスク、最小再投影誤差)を用いたシンプルなベースラインモデルを採用し、2つの提案された要素で強化する。

実験結果

リサーチクエスチョン

  • RQ1遮蔽および非定常ピクセルからの光度誤差を効果的にフィルタリングすることで、教師なし単眼学習における深度推定をどのように改善できるか?
  • RQ2反対方向に動く物体が深度推定に与える影響は何か?そして、教師なしフレームワークでそれらをどのようによりよく扱えるか?
  • RQ3軽量でモジュラーなアプローチは、複雑な補助モジュールを追加せずに、深度マップの品質を向上させられるか?
  • RQ4アウ tiers マスクと重み付きマルチスケール学習の統合は、アーティファクト低減および全体的な性能にどのように影響を与えるか?
  • RQ5これらの技術は、KITTIのような標準ベンチマークで、どれほど最先端の性能を向上させられるか?

主な発見

  • 提案されたアウ tiers マスク技術により、対向する車両などの反対方向に動く物体の深度推定における過小評価が顕著に低減された。これは、従来の手法でしばしば不正確に推定される領域である。
  • 重み付きマルチスケール方式により、深度マップのアーティファクトが効果的に低減され、元の論文で報告された失敗事例に対しても、Monodepth2を上回る性能を示した。
  • アウ tiers マスクと重み付きマルチスケール方式の組み合わせにより、個々の貢献の合計を上回る性能向上が得られた。これは、強い相乗効果を示している。
  • DiPEは、KITTI深度推定ベンチマークで最先端の性能を達成し、従来の教師なし手法よりも深度推定および自己運動推定の両面で優れた結果を出した。
  • KITTIオドメトリスプリットにおいて、5フレーム入力で、シーケンス09では平均絶対軌道誤差(ATE)が0.012 ± 0.006 m、シーケンス10では0.012 ± 0.008 mを達成し、SOTAモデルと同等またはそれを上回った。
  • 2、3、5フレームの運動ネットワークという異なる入力設定においても、DiPEは一貫した性能を示し、精度の顕著な低下を示さなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。