[論文レビュー] Learning monocular depth estimation infusing traditional stereo knowledge
本論文では、特徴変換を用いて単一入力から仮想的な右画像を合成し、実際の特徴と合成された特徴の間でステレオマッチングを実行する、自己教師付き単眼深度推定のための新規エンドツーエンドディープラーニングアーキテクチャであるmonoResMatchを提案する。伝統的なステレオアルゴリズム(例:Semi-Global Matching (SGM))から得られるプロキシの真値を活用することで、実際の深度アノテーションを一切必要とせず、KITTIベンチマークで最先端の性能を達成する。
Depth estimation from a single image represents a fascinating, yet challenging problem with countless applications. Recent works proved that this task could be learned without direct supervision from ground truth labels leveraging image synthesis on sequences or stereo pairs. Focusing on this second case, in this paper we leverage stereo matching in order to improve monocular depth estimation. To this aim we propose monoResMatch, a novel deep architecture designed to infer depth from a single input image by synthesizing features from a different point of view, horizontally aligned with the input image, performing stereo matching between the two cues. In contrast to previous works sharing this rationale, our network is the first trained end-to-end from scratch. Moreover, we show how obtaining proxy ground truth annotation through traditional stereo algorithms, such as Semi-Global Matching, enables more accurate monocular depth estimation still countering the need for expensive depth labels by keeping a self-supervised approach. Exhaustive experimental results prove how the synergy between i) the proposed monoResMatch architecture and ii) proxy-supervision attains state-of-the-art for self-supervised monocular depth estimation. The code is publicly available at https://github.com/fabiotosi92/monoResMatch-Tensorflow.
研究の動機と目的
- 単一の画像に深度の手がかりが欠落しているため、不適切な問題である単眼深度推定の課題に対処すること。
- オクルージョンや動きに起因する誤差を引き起こす可能性があるため、画像のワープに依存する自己教師付き学習の限界を克服すること。
- 特にSGMからのプロキシ監督を含む、伝統的なステレオ知識を単眼深度ネットワークに統合することで、深度推定の精度を向上させること。
- 仮想的な第二視点から特徴を合成することで、ステレオマッチングを模倣するエンドツーエンドで訓練可能なアーキテクチャを開発すること。
- 古典的ステレオアルゴリズムからのプロキシ監督が、画像ワープに基づく自己教師付き監督よりも単眼深度推定で優れた性能を発揮することを実証すること。
提案手法
- 単眼入力画像を特徴空間にマップし、水平方向に整列された仮想的な右画像表現を合成する、統合された深層ネットワーク(monoResMatch)を設計する。
- 実際の左画像特徴と合成された右画像特徴の間でステレオマッチングを実行するための相関ベースの精練モジュールを適用し、伝統的なステレオマッチングを模倣する。
- 入力画像にSemi-Global Matching (SGM) を適用して、プロキシの真値である不透明度マップを生成し、学習プロセスの監督に使用する。
- 実際の深度アノテーションを必要とせず、プロキシのSGMラベルを監督として用いて、ネットワーク全体をエンドツーエンドでスクラッチから訓練する。
- 入力と合成された視点の間の幾何学的整合性を活用し、微分可能なワープと損失最小化によって深度推定の精度を向上させる。
- 残差接続とマルチスケール特徴学習を統合することで、特徴表現と深度予測の品質を向上させる。
実験結果
リサーチクエスチョン
- RQ1仮想ステレオビューを合成し、ステレオマッチングを実行することで、単眼深度推定ネットワークが最先端の性能を達成できるか?
- RQ2従来のステレオアルゴリズム(例:SGM)から得られるプロキシ真値を用いることで、画像ワープに基づく自己教師付き監督よりも優れた深度推定が可能か?
- RQ3ステレオマッチングの原則を統合したエンドツーエンドで訓練されたネットワークは、既存の自己教師付き単眼深度モデルを上回ることができるか?
- RQ4monoResMatchアーキテクチャとプロキシ監督の相乗効果は、合成または実際の深度ラベルで訓練されたモデルと比較してどのように異なるか?
- RQ5外れ値を含むにもかかわらず、SGMからのプロキシ監督は、代替の自己教師付きベースラインよりもより正確な深度予測をもたらすか?
主な発見
- monoResMatchはKITTI 2015テストスプリットでD1-all誤差21.72%を達成し、すべての自己教師付きベースライン(monodepthやSVSを含む)を上回る性能を示した。
- SVSと比較して、D1-bg誤差を3%以上、D1-fg誤差をほぼ1%低減し、背景領域および前面領域の両方で優れた性能を示した。
- KITTIから500件のLiDARアノテート済みサンプルと200-acrtデータを用いた場合、30,000組以上のステレオペアで訓練されたモデルをすべて上回る最高の性能を達成した。
- SGMによって生成されたプロキシラベルを用いることで、外れ値を含んでも画像ワープに基づく自己教師付き監督よりも正確な深度予測が得られた。
- プロキシ監督を用いたmonoResMatchのエンドツーエンド訓練により、前回の最先端自己教師付き手法(SVS)と比較して、D1-all誤差が2.72%絶対的に改善された。
- このフレームワークはノイズの多いプロキシラベルに対しても頑健であり、高い精度を維持しており、実際の深度監督がなくても、伝統的なステレオ知識が単眼深度学習を効果的にガイドできることを証明した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。