[論文レビュー] Unsupervised Video Depth Estimation Based on Ego-motion and Disparity Consensus
本稿では、左右の視差一貫性とビュー合成損失を統合することで、深度推定と自己移動量推定を向上させる自己教師付き単眼動画深度推定手法を提案する。時間的およびステレオ一貫性とエッジ認識平滑化正則化を活用することで、ベースライン手法が要する学習データの60%のみで競争力ある性能を達成し、KITTIおよびMake3Dデータセットにおいて一部の教師あり手法を上回る性能を発揮する。
Unsupervised learning based depth estimation methods have received more and more attention as they do not need vast quantities of densely labeled data for training which are touch to acquire. In this paper, we propose a novel unsupervised monocular video depth estimation method in natural scenes by taking advantage of the state-of-the-art method of Zhou et al. which jointly estimates depth and camera motion. Our method advances beyond the baseline method by three aspects: 1) we add an additional signal as supervision to the baseline method by incorporating left-right binocular images reconstruction loss based on the estimated disparities, thus the left frame can be reconstructed by the temporal frames and right frames of stereo vision; 2) the network is trained by jointly using two kinds of view syntheses loss and left-right disparity consistency regularization to estimate depth and pose simultaneously; 3) we use the edge aware smooth L2 regularization to smooth the depth map while preserving the contour of the target. Extensive experiments on the KITTI autonomous driving dataset and Make3D dataset indicate the superiority of our algorithm in training efficiency. We can achieve competitive results with the baseline by only 3/5 times training data. The experimental results also show that our method even outperforms the classical supervised methods that using either ground truth depth or given pose for training.
研究の動機と目的
- 密集した深度アノテーションを必要としない自己教師付き単眼動画深度推定手法の開発を目的とする。
- ステレオ一貫性とビュー合成損失を組み込むことで、学習効率と深度推定精度を向上させることを目的とする。
- ラベル付き大規模データセットへの依存を減らすために、ラベルなし動画シーケンスを活用することを目的とする。
- エッジ認識正則化を用いて深度マップの境界を保持しながら、深度予測の平滑化を目的とする。
- 教師あり手法と同等またはそれ以上の性能を、学習データのわずかな割合のみで達成することを目的とする。
提案手法
- 本手法は、Zhouらの自己教師付き深度推定フレームワークを拡張し、推定された視差に基づく左右二眼画像再構成損失を導入する。
- 時間的フレームからのビュー合成損失と、ステレオ視差一貫性からのビュー合成損失の両方を用いて、深度と自己移動量を同時に最適化する。
- 予測された左右視差が対称的かつ一貫するように保証する視差一貫性正則化項を導入する。
- 物体境界を保持しながら深度マップの平滑化を実現するため、エッジ認識平滑L2正則化を適用する。
- 光度的一致性とステレオ的一致性から得られる自己教師信号を用いて、ラベルなし動画シーケンスを用いてエンドツーエンドでネットワークを学習する。
- 単眼動画シーケンスとステレオ画像ペアの両方を活用することで、深度推定のロバスト性を向上させる。
実験結果
リサーチクエスチョン
- RQ1ステレオ一貫性とビュー合成損失は、単眼動画シーケンスにおける自己教師付き深度推定をどのように改善するか?
- RQ2左右視差一貫性を組み込むことで、深度マップ品質と学習収束性にどのような影響を与えるか?
- RQ3教師ありベースラインと比較して、性能を維持または向上させつつ、どの程度学習データを削減できるか?
- RQ4エッジ認識正則化は、物体境界における深度マップの精度をどのように向上させるか?
- RQ5教師あり手法が持つ真値深度の教師信号なしに、自己教師付き手法が同等の性能を達成できるか?
主な発見
- 提案手法は、ベースライン自己教師付き手法が要する学習データの60%のみで、競争力ある深度推定性能を達成した。
- KITTIデータセットでは、真値深度または既知のポーズを用いた多数の古典的教師あり深度推定手法を上回った。
- ステレオ一貫性とビュー合成損失の導入により、一般化性能が向上し、収束速度も速くなった。
- エッジ認識平滑化正則化は、滑らかな領域でのノイズ低減と、鋭い境界の保持の両方を実現し、深度マップ品質を顕著に向上させた。
- 時間的およびステレオビュー合成損失の組み合わせにより、シーケンス全体にわたるより正確で一貫性のある深度予測が得られた。
- 最小限の自己教師信号で、KITTIおよびMake3Dベンチマークにおいて、自己教師付き手法として最先端の性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。