Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Learning of Monocular Depth Estimation with Bundle Adjustment, Super-Resolution and Clip Loss

Lipu Zhou, Jiamin Ye|arXiv (Cornell University)|Dec 8, 2018
Advanced Vision and Imaging参考文献 50被引用数 19
ひとこと要約

本稿では、バndlge adjustment、スーパー解像度、CLIP損失を統合した教師なし単眼深度推定フレームワークを提案する。長基準距離でのカメラポーズと深度の共同最適化、高解像度深度マップを生成するスーパー解像度ネットワークの使用、および動く物体や隠蔽による誤差を軽減するCLIP損失の適用により、KITTI上で最先端の性能を達成し、従来の教師なし単眼手法を上回り、ステレオベース手法に近づいた。

ABSTRACT

We present a novel unsupervised learning framework for single view depth estimation using monocular videos. It is well known in 3D vision that enlarging the baseline can increase the depth estimation accuracy, and jointly optimizing a set of camera poses and landmarks is essential. In previous monocular unsupervised learning frameworks, only part of the photometric and geometric constraints within a sequence are used as supervisory signals. This may result in a short baseline and overfitting. Besides, previous works generally estimate a low resolution depth from a low resolution impute image. The low resolution depth is then interpolated to recover the original resolution. This strategy may generate large errors on object boundaries, as the depth of background and foreground are mixed to yield the high resolution depth. In this paper, we introduce a bundle adjustment framework and a super-resolution network to solve the above two problems. In bundle adjustment, depths and poses of an image sequence are jointly optimized, which increases the baseline by establishing the relationship between farther frames. The super resolution network learns to estimate a high resolution depth from a low resolution image. Additionally, we introduce the clip loss to deal with moving objects and occlusion. Experimental results on the KITTI dataset show that the proposed algorithm outperforms the state-of-the-art unsupervised methods using monocular sequences, and achieves comparable or even better result compared to unsupervised methods using stereo sequences.

研究の動機と目的

  • 教師なし単眼とステレオベース深度推定手法の性能差を縮小すること。
  • 従来の教師なし単眼フレームワークの短基準距離の制限を克服し、長距離の幾何的制約を可能にすること。
  • 低解像度の深度推定と双線形補間によるものと比較して、境界アーチファクトを低減すること。
  • 教師なしの環境下で動く物体や隠蔽に対するロバスト性を向上させること。
  • 学習可能なスーパー解像度ネットワークを用いて、低解像度入力から高解像度深度予測を可能にすること。

提案手法

  • 長期間にわたる単眼フレームのシーケンスにおいて、カメラポーズと深度マップを共同で最適化するバndlge adjustmentフレームワークを採用し、有効な基準距離を拡大する。
  • 低解像度入力から直接高解像度深度マップを予測するためのスーパー解像度ネットワークを学習し、補間誤差を回避する。
  • 非連続フレーム間の写真的一致性と深度的一致性を強制するため、クロスシーケンス幾何的一致性損失を導入する。
  • 動く物体や隠蔽による高勾配誤差を制限するCLIP損失関数を導入し、学習の不安定化を防ぐ。
  • 視覚合成を監視信号として用い、静的シーンの仮定に基づく写真的一致性に依存する。
  • 教師なしの環境下で、写真的損失、幾何的損失、CLIP損失の組み合わせにより、エンドツーエンドでモデルを訓練する。この際、教師あり深度データは不要である。

実験結果

リサーチクエスチョン

  • RQ1カメラポーズと深度を共同で最適化するバndlge adjustmentフレームワークは、教師なし単眼学習における深度推定精度を向上させることができるか?
  • RQ2双線形補間と比較して、専用のスーパー解像度ネットワークは境界アーチファクトを低減するか?
  • RQ3CLIP損失関数は、教師なし深度学習における動く物体や隠蔽による性能低下を効果的に緩和できるか?
  • RQ4単眼教師なし手法が、ベンチマークデータセットでステレオベース手法とどの程度同等の性能を達成できるか?
  • RQ5提案手法は、解像度やシーン特性が異なるデータセットに対してもどの程度一般化できるか?

主な発見

  • 提案手法はKITTIテストスプリットで平均絶対誤差(AbsRel)0.139を達成し、GeoNet(0.155)やDF-Net(0.150)といった従来の教師なし単眼手法を上回った。
  • 相対誤差(Rel)は1.057、閾値精度(δ < 1.25)は0.975を達成し、複数の指標で優れた性能を示した。
  • アブレーションスタディの結果、スーパー解像度ネットワークを削除すると顕著な境界アーチファクトが生じる一方、CLIP損失を省略すると動的シーンへの感受性が高まることが確認された。
  • バndlge adjustmentによるクロスシーケンス制約の導入により、有効基準距離が拡大され、深度推定の安定性と精度が向上した。
  • Make3Dデータセットでは解像度の不一致にもかかわらず良好な一般化性能を示し、強力なドメイン転送能力を示した。
  • ステレオベースの教師なし手法と同等の性能を達成し、単眼とステレオの学習戦略の間のギャップを顕著に縮小した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。