Skip to main content
QUICK REVIEW

[論文レビュー] DFineNet: Ego-Motion Estimation and Depth Refinement from Sparse, Noisy Depth Input with RGB Guidance

Yilun Zhang, Ty Nguyen|arXiv (Cornell University)|Mar 15, 2019
Advanced Vision and Imaging参考文献 32被引用数 15
ひとこと要約

DFineNetは、RGBのガイダンスを用いて、スパースでノイジーな深度入力を同時に補正し、カメラの自己移動量をエンド・ツー・エンドで推定する深層学習フレームワークを提案する。深度とポーズのネットワークを同時に学習させることで、特にスパースでノイジーな深度入力の条件下でも、深度補完とポーズ推定の両方で優れた性能を達成し、KITTIおよびTUMデータセットにおいて最先端の手法を上回る性能を発揮する。

ABSTRACT

Depth estimation is an important capability for autonomous vehicles to understand and reconstruct 3D environments as well as avoid obstacles during the execution. Accurate depth sensors such as LiDARs are often heavy, expensive and can only provide sparse depth while lighter depth sensors such as stereo cameras are noiser in comparison. We propose an end-to-end learning algorithm that is capable of using sparse, noisy input depth for refinement and depth completion. Our model also produces the camera pose as a byproduct, making it a great solution for autonomous systems. We evaluate our approach on both indoor and outdoor datasets. Empirical results show that our method performs well on the KITTI~\cite{kitti_geiger2012we} dataset when compared to other competing methods, while having superior performance in dealing with sparse, noisy input depth on the TUM~\cite{sturm12iros} dataset.

研究の動機と目的

  • SWaP(サイズ、重量、消費電力)制約下での自律システムにおける正確な深度および自己移動量推定の課題に対処すること。
  • RGBおよびスパースでノイジーな深度入力を用いて、深度とポーズのネットワークを同時に学習させることで、深度補完とポーズ推定を向上させること。
  • 従来の手法が深度とポーズ推定を別々に処理するか、ノイズのない深度入力を仮定するという制限を克服すること。
  • ノイジーなステレオカメラやスパースLiDARを含む多様な深度センサーに対して、頑健な性能を発揮できるようにすること。
  • RGBと深度からのクロスモodalな監視を活用して、深度品質とポーズ精度の両方を向上させる統合フレームワークを構築すること。

提案手法

  • フレームワークは、RGB画像とスパース深度入力を条件として、深度推定用と自己移動量(ポーズ)推定用の2本の畳み込みニューラルネットワークからなる二重ブランチ構造を採用する。
  • 連続フレーム間の幾何的整合性を活用して、スパースでノイジーな深度マップを精緻化する微分可能で微分可能な深度精緻化モジュールを採用する。
  • 光度再構成損失、深度監視損失、ポーズ回帰損失を組み合わせたマルチタスク損失を用いて、エンド・ツー・エンドで学習を行う。
  • 主なイノベーションは、深度とポーズの共同最適化であり、ポーズ推定が深度補完をガイドし、逆に深度補完がポーズ推定を向上させるという相互作用により、より高い頑健性を実現する。
  • 推定されたポーズを用いてRGB画像をワープする微分可能なワープレイヤーを活用し、画像再構成から深度推定を監視する。
  • 一般化性能を向上させるために、トレーニング段階でデータオーグメンテーションとノイズモデリングを組み込む。

実験結果

リサーチクエスチョン

  • RQ1深度補完と自己移動量推定の共同学習は、分離型アプローチと比較して、両タスクの性能を向上させることができるか?
  • RQ2低コストのステレオカメラやToFセンサーからのスパースでノイジーな入力において、モデルの性能はいかがであるか?
  • RQ3RGBと深度の監視を用いたエンド・ツー・エンド学習は、クリーンで高密度な深度を監視に用いる手法よりも、より優れた一般化性能を発揮するか?
  • RQ4厳しい条件下におけるポーズ精度と深度補完品質の観点から、最先端の手法と比較して、モデルの性能はどの程度か?
  • RQ5ローリングシャッター歪みや低テクスチャ環境といった実世界のセンサー制限に対しても、モデルは効果的に対処できるか?

主な発見

  • TUM RGBDデータセットでは、比較手法の中で最小のATE(0.0101 m)とRE(0.0021)を達成し、Ma [13] や sfmlearner を上回った。
  • ノイジーな入力下での深度補完において、DFineNetはノイズ付きトレーニング時でRMSEが180.63、ノイズなしでトレーニングしたがノイズありでテストした場合に779.58を記録し、ノイジーな条件下でSfmlearner や Ma [13] を顕著に上回った。
  • TUMにおける光度損失は0.0369と、すべての手法の中で最小であり、優れた画像再構成品質を示している。
  • KITTIデータセットでは、光度損失が0.0726と最小であり、一部のベースラインよりもATEとREが高かったが、真値深度とポーズとの整合性が優れていた。
  • 図4の定性的な結果では、DFineNetは特にテクスチャが乏しい領域でも、より密度が高く、より正確な深度マップを生成し、アーチファクトが少ないことが示された。
  • アブレーションスタディの結果、ノイズ付き深度入力での共同学習が、より高い頑健性をもたらすことが確認された。クリーンな深度でのみ学習したモデルは、ノイズ付き入力でテストした際に失敗した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。