[論文レビュー] Learning monocular depth estimation with unsupervised trinocular assumptions
本論文は、ステレオアーチファクトを軽減するため、交互に訓練する戦略を用いて二眼ステレオペアで学習することで三眼監視を活用する、3Netと呼ばれる新しい教師なし単眼深度推定ネットワークを提案する。中央の参照画像から左および右のコンテキストを用いて深度をモデル化することで、KITTIで最先端の性能を達成し、実際の三眼データを用いていないにもかかわらず、先行する教師なし手法を上回る。
Obtaining accurate depth measurements out of a single image represents a fascinating solution to 3D sensing. CNNs led to considerable improvements in this field, and recent trends replaced the need for ground-truth labels with geometry-guided image reconstruction signals enabling unsupervised training. Currently, for this purpose, state-of-the-art techniques rely on images acquired with a binocular stereo rig to predict inverse depth (i.e., disparity) according to the aforementioned supervision principle. However, these methods suffer from well-known problems near occlusions, left image border, etc inherited from the stereo setup. Therefore, in this paper, we tackle these issues by moving to a trinocular domain for training. Assuming the central image as the reference, we train a CNN to infer disparity representations pairing such image with frames on its left and right side. This strategy allows obtaining depth maps not affected by typical stereo artifacts. Moreover, being trinocular datasets seldom available, we introduce a novel interleaved training procedure enabling to enforce the trinocular assumption outlined from current binocular datasets. Exhaustive experimental results on the KITTI dataset confirm that our proposal outperforms state-of-the-art methods for unsupervised monocular depth estimation trained on binocular stereo pairs as well as any known methods relying on other cues.
研究の動機と目的
- 教師なし単眼深度推定における二眼ステレオ監視の限界、特にオクルージョン付近や画像端縁におけるアーチファクトを解決すること。
- 実際の三眼データセットの不足を補うために、KITTI や CityScapes などの標準的な二眼ステレオデータセット上で効果的な学習を可能にすること。
- 中央の参照画像に左および右のコンテキストを組み合わせた三視点幾何学を活用することで、深度推定の精度を向上させること。
- 後続タスクに役立つ新しい応用、例えば合成マルチベースラインステレオペアの生成を可能にすること。
- 二眼データで学習しながら三眼のインダクティブバイアスを強制することで、公平な比較ベースラインを確立し、SOTAの教師なし手法を上回ることを証明すること。
提案手法
- 左および右の視点を補助視点として用い、中央の参照画像から視差マップを予測するためのCNNを訓練し、三眼の一貫性を強制する。
- バックプロパゲーション中に左および右のワーピング目的を交互に切り替えることで、三眼監視を模倣するインタ leaves 訓練手順を設計する。
- 教師なし深度推定のため、参照画像とワープされた左/右視点の間の画像再構成損失(ワープ誤差)を用い、真の深度情報が不要な状態で視差予測を監視する。
- ネットワークが左および右の視差($d^{lc}$, $d^{rc}$)を予測できる能力を活用し、1枚の入力画像から新たな仮想視点を合成する。
- 合成ステレオペアに半グローバルマッチング(SGM)を適用し、生成された三眼視点の品質とステレオアルゴリズムへの有用性を検証する。
- 共有エンコーダ(VGGまたはResNet50)と左および右の視差予測用の別々のヘッドを備えたマルチスケールアーキテクチャを採用し、エンドツーエンドの訓練を可能にする。
実験結果
リサーチクエスチョン
- RQ1教師なし設定下で、二眼ステレオ監視を上回る三眼監視が単眼深度推定を改善できるか?
- RQ2新たな訓練戦略を用いることで、二眼ステレオデータセットから三眼のインダクティブバイアスをどの程度学習できるか?
- RQ3本手法は、二眼ベースの教師なし手法と比較して、オクルージョンや画像端縁における一般的なステレオアーチファクトを軽減できるか?
- RQ41枚の画像から妥当な合成ステレオペアを生成し、マルチベースラインステレオ処理を可能にできるか?
- RQ5本手法の3Netの性能は、標準ベンチマーク上でSOTAの教師なし単眼深度推定手法と定量的に比較してどの程度か?
主な発見
- 3NetはKITTI 2015テストセットで最先端の性能を達成し、後処理を用いていないにもかかわらず、Godardら[12]の前回のSOTA手法を上回った。
- ResNet50を用いた3Netと後処理を組み合わせた場合、Godardら[12]の最良設定(ResNet50 + 後処理)を上回り、より優れた精度を示した。
- 本手法は、光流や運動からの深度などの他の手がかりに依存する既知のすべての教師なし深度推定フレームワークを上回った。
- インタ leaves 訓練プロトコルにより、二眼データセット上で効果的な三眼監視が可能となり、性能向上はデータ量ではなく三眼のインダクティブバイアスに起因することが証明された。
- 1枚の画像から合成された仮想ステレオペアはマルチベースラインステレオマッチングを可能にし、SGMを狭いおよび広いベースラインに適用した場合、一貫した視差範囲が得られた。
- ネットワークは1枚の入力から妥当な新たな視点(左および右)を生成でき、ステレオネットワークのデータ拡張や単一視点ステレオの新しい応用を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。