Skip to main content
QUICK REVIEW

[論文レビュー] UnDEMoN 2.0: Improved Depth and Ego Motion Estimation through Deep Image Sampling

V. Madhu Babu, Swagat Kumar|arXiv (Cornell University)|Nov 27, 2018
Advanced Vision and Imaging参考文献 22被引用数 4
ひとこと要約

UnDEMoN 2.0 は、画像再構成精度を向上させるために、ディープ画像サンプリングネットワーク(DISNet)と双線形サンプリングを統合することで、軽量で改善された単眼深度および自己運動推定ネットワークを提案する。このハイブリッドアプローチにより、元の UnDEMoN の 25% のパラメータで KITTI データセットで最先端の性能を達成し、モデルサイズを削減しながら深度およびポーズ推定の精度を顕著に向上させた。

ABSTRACT

In this paper, we provide an improved version of UnDEMoN model for depth and ego motion estimation from monocular images. The improvement is achieved by combining the standard bi-linear sampler with a deep network based image sampling model (DIS-NET) to provide better image reconstruction capabilities on which the depth estimation accuracy depends in un-supervised learning models. While DIS-NET provides higher order regression and larger input search space, the bi-linear sampler provides geometric constraints necessary for reducing the size of the solution space for an ill-posed problem of this kind. This combination is shown to provide significant improvement in depth and pose estimation accuracy outperforming all existing state-of-the-art methods in this category. In addition, the modified network uses far less number of tunable parameters making it one of the lightest deep network model for depth estimation. The proposed model is labeled as "UnDEMoN 2.0" indicating an improvement over the existing UnDEMoN model. The efficacy of the proposed model is demonstrated through rigorous experimental analysis on the standard KITTI dataset.

研究の動機と目的

  • 画像再構成能力を向上させることで、教師なし単眼深度推定における深度および自己運動推定の精度を向上させること。
  • パフォーマンスを維持または向上させながら、モデルの複雑さとパラメータ数を削減すること。
  • ディープラーニングベースの画像サンプリングの長所と、双線形サンプリングによる幾何的制約を組み合わせ、より良い一般化性能を実現すること。
  • 教師なし深度推定の不適切な定式化を、高次元の回帰と幾何的事前知識の両方を活用することで是正すること。
  • Eigen スプリットを用いた KITTI ベンチマークで、既存の最先端手法を上回る優れた性能を示すこと。

提案手法

  • 全画像入力を用いて、画像再構成のための高次元回帰を実行するディープ画像サンプリングネットワーク(DISNet)を導入し、標準的な双線形サンプリングに代わる。
  • DISNet と双線形画像サンプラー(BIS)を組み合わせることで、高精度な補間と幾何的制約の両方を活用し、不適切な定式化の解空間を縮小する。
  • DispNet と DISNet の両方でマルチスケールアーキテクチャを採用することで、特徴表現と再構成忠実度を向上させる。
  • 層の数を減らすことで軽量なネットワーク設計を実現し、合計パラメータ数を元の UnDEMoN モデルの 25% にまで削減した。
  • DISNet と BIS からの再構成損失に加え、ポーズの一貫性と深度正則化を組み合わせてモデルを訓練する。
  • 予測された深度とポーズを用いて逆方向の画像ワープを実行し、光度的一致性損失を最小化することで、元の画像を再構成する。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースの画像サンプリングネットワークは、教師なし深度推定における標準的な双線形サンプリングに比べ、再構成精度を向上させることができるか?
  • RQ2ディープ画像サンプリングと幾何的制約付き双線形サンプリングを組み合わせることで、単独で使用する場合よりも優れた深度およびポーズ推定が達成できるか?
  • RQ3単眼深度推定において、パフォーマンスを損なわずに顕著なパラメータ数の削減が可能か?
  • RQ4KITTI データセットにおける最先端の教師なし深度推定モデルと比較して、本手法はどのように性能を発揮するか?
  • RQ5画像再構成における高次元回帰の使用は、再構成誤差をどれほど低減させ、深度推定の精度を向上させるか?

主な発見

  • UnDEMoN 2.0 は、単眼深度および自己運動推定において KITTI の Eigen スプリットで最先端の性能を達成し、既存のすべての教師なし手法を上回った。
  • トレーニング可能なパラメータ数を元の UnDEMoN の 25% にまで削減し、深度推定用の最も軽量なディープニューラルネットワークの一つとなった。
  • DISNet と双線形サンプリングの組み合わせにより、画像再構成誤差が低減され、深度およびポーズ推定の精度が向上した。
  • KITTI データセットにおいて、絶対相対差、二乗相対差、RMSE linear、RMSE log、および閾値指標のすべてで優れた結果を達成した。
  • 図 6 の定性的な結果から、特に大規模な動きを伴う困難なシーンにおいて、UnDEMoN 2.0 は SOTA 手法に比べてよりシャープで正確な深度予測を生成することがわかった。
  • 構造的類似度指数(SSIM)の結果から、UnDEMoN 2.0 が生成する再構成画像が、競合モデルのものよりも人間の知覚に近いことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。