[論文レビュー] Toward Hierarchical Self-Supervised Monocular Absolute Depth Estimation for Autonomous Driving Applications
本論文では、追加のセンサを用いずに絶対深度予測を可能にするとともに、オブジェクトレベルの深度推定精度を向上させる自己教師付き単眼深度推定フレームワーク、DNetを提案する。階層的特徴精錬のためのDense Connected Prediction(DCP)層と、地面平面の幾何構造を用いたスケール回復のためのDense Geometrical Constraint(DGC)モジュールを導入することで、DNetはLiDARの真値を用いた手法と同等の最先端の性能を達成しており、特に画像ピクセルの1.03%を超える地面ピクセルを有する場合に顕著である。
In recent years, self-supervised methods for monocular depth estimation has rapidly become an significant branch of depth estimation task, especially for autonomous driving applications. Despite the high overall precision achieved, current methods still suffer from a) imprecise object-level depth inference and b) uncertain scale factor. The former problem would cause texture copy or provide inaccurate object boundary, and the latter would require current methods to have an additional sensor like LiDAR to provide depth ground-truth or stereo camera as additional training inputs, which makes them difficult to implement. In this work, we propose to address these two problems together by introducing DNet. Our contributions are twofold: a) a novel dense connected prediction (DCP) layer is proposed to provide better object-level depth estimation and b) specifically for autonomous driving scenarios, dense geometrical constrains (DGC) is introduced so that precise scale factor can be recovered without additional cost for autonomous vehicles. Extensive experiments have been conducted and, both DCP layer and DGC module are proved to be effectively solving the aforementioned problems respectively. Thanks to DCP layer, object boundary can now be better distinguished in the depth map and the depth is more continues on object level. It is also demonstrated that the performance of using DGC to perform scale recovery is comparable to that using ground-truth information, when the camera height is given and the ground point takes up more than 1.03\% of the pixels. Code is available at https://github.com/TJ-IPLab/DNet.
研究の動機と目的
- 自己教師付き単眼深度推定における不正確なオブジェクトレベルの深度推定を是正すること。
- 単眼深度推定におけるスケール回復にLiDARやステレオカメラに依存しないこと。
- 単一のRGB画像から絶対深度予測を可能にすることで、自己教師付き深度推定の自動運転分野への実用的導入を実現すること。
- 階層的特徴学習により深度マップの連続性と境界精度を向上させること。
- 地面平面からの幾何制約を用いた、センサフリーなスケール回復手法の開発
提案手法
- 多スケール特徴を段階的に統合するためのDense Connected Prediction(DCP)層を導入し、オブジェクトレベルの深度推定を向上させるとともに、視覚的アーチファクトを低減する。
- DCP層はスケール間の特徴を統合することで深度予測を精錬し、境界の定義を明確にし、深度の連続性を向上させる。
- 絶対深度を推定するために、地面ピクセルを検出し、それらからカメラ高さを計算するDense Geometrical Constraint(DGC)モジュールを提案する。
- DGCモジュールは統計的手法を用いて地面ピクセル検出の外れ値を抑制し、推定されたカメラ高さと与えられたカメラ高さを比較してスケール係数を計算する。
- 自己教師付き学習のために光度再構成損失を用い、DGCにより真値深度が不要なスケールキャリブレーションを実現する。
- 本手法はKITTI Eigenスプリット上でエンドツーエンドに学習され、推論時間は50.0ms、DGCによるスケール回復は4.1msである。
実験結果
リサーチクエスチョン
- RQ1階層的特徴学習は、自己教師付き単眼深度推定におけるオブジェクトレベルの深度境界精度を向上させ得るか?
- RQ2LiDARやステレオ監視なしに、単眼画像から絶対深度を回復できるか?
- RQ3地面ピクセルの比率が変化する条件下でも、DGCモジュールのスケール回復性能は頑健か?
- RQ4DGCに基づくスケール回復は、LiDARに基づくスケールキャリブレーションと同等または優れた性能を示すか?
- RQ5DGCに基づくスケール推定が信頼できるために必要な最小の地面ピクセル比率はどの程度か?
主な発見
- DCP層は、ベースラインとの定性的比較において、オブジェクト境界の定義を著しく向上させるとともに、深度アーチファクトを低減している。
- 地面ピクセルが画像ピクセルの1.03%を超えると、DGCモジュールは真値ベースの手法と同等のスケール回復性能を達成する。
- テストフレームの31.7%から45.2%の間で、DGCモジュールは少なくとも4つの評価指標の1つ以上において、LiDARベースのスケール回復を上回っている。
- 地面ピクセル比率が十分に高い場合、DGCモジュールは多様なシーンにおいて頑健で一貫性のある性能を示している。
- DNetパイプライン全体はKITTI Eigenスプリットで競争力のある性能を達成しており、推論時間は50.0ms、DGCスケール回復は4.1msである。
- アブレーションスタディにより、DCP層およびDGCモジュールの有効性が確認され、感度解析では1.03%未満の地面ピクセル比率で性能が低下することが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。