Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Frame Self-Supervised Depth with Transformers

Vitor Guizilini, Rareş Ambruş|arXiv (Cornell University)|Apr 15, 2022
Advanced Vision and Imaging被引用数 7
ひとこと要約

この論文では、深さに離散化されたエピポラーフレーミング・サンプリングと自己およびクロスアテンション機構を用いて特徴マッチングを精緻化することで、マルチフレーム自己教師付き単眼深度推定を向上させるトランスフォーマー基盤アーキテクチャであるDepthFormerを提案する。本手法はKITTIおよびDDADで最先端の性能を達成し、自己教師付きマルチフレーム手法および教師あり単フレームモデルを上回り、データセット間で転送可能なアテンションベースの表現を実現する。

ABSTRACT

Multi-frame depth estimation improves over single-frame approaches by also leveraging geometric relationships between images via feature matching, in addition to learning appearance-based features. In this paper we revisit feature matching for self-supervised monocular depth estimation, and propose a novel transformer architecture for cost volume generation. We use depth-discretized epipolar sampling to select matching candidates, and refine predictions through a series of self- and cross-attention layers. These layers sharpen the matching probability between pixel features, improving over standard similarity metrics prone to ambiguities and local minima. The refined cost volume is decoded into depth estimates, and the whole pipeline is trained end-to-end from videos using only a photometric objective. Experiments on the KITTI and DDAD datasets show that our DepthFormer architecture establishes a new state of the art in self-supervised monocular depth estimation, and is even competitive with highly specialized supervised single-frame architectures. We also show that our learned cross-attention network yields representations transferable across datasets, increasing the effectiveness of pre-training strategies. Project page: https://sites.google.com/tri.global/depthformer

研究の動機と目的

  • 自己教師付き単眼深度推定を向上させるために、アテンション機構を用いてマルチフレーム特徴マッチングを強化すること。
  • テクスチャが欠落している領域や動的領域による曇りや局所的最小値を引き起こす伝統的な類似度ベースのコストボリューム生成の限界を解消すること。
  • 幾何学的に根拠を持つアテンション機構を設計し、より良い深度予測のためのマッチング確率を精緻化すること。
  • 学習されたマッチング関数を異なるデータセット間で転送可能にすることで、事前学習の効率と収束性を向上させること。
  • 教師付き深度情報や明示的な監視を一切必要としない状態で最先端の性能を達成すること。

提案手法

  • 本手法は、ターゲット画像とコンテキスト画像の特徴間の候補マッチングを生成するために深さに離散化されたエピポラーフレーミング・サンプリングを用いる。
  • 独自のトランスフォーマー基盤モジュールが自己およびクロスアテンションを適用し、標準的な類似度指標を上回るピクセルごとのマッチング確率を精緻化する。
  • 精緻化されたコストボリュームは、高応答ウィンドウフィルタリングを用いて深度マップに変換され、単一フレーム特徴と統合されて耐性を高める。
  • 全パイプラインは、動画シーケンスからの光度再構成損失のみを用いてエンドツーエンドで訓練される。
  • アテンション機構は幾何学的に根拠を持つように設計されており、困難なシーンにおける対応精度を向上させる。
  • 本モデルはマルチフレームの幾何的ヒントと単一フレームの外観特徴を併用することで、動的物体や運動が不足する場合の失敗ケースに対処する。

実験結果

リサーチクエスチョン

  • RQ1自己およびクロスアテンション機構は、マルチフレーム自己教師付き深度推定における特徴マッチングの信頼性を向上させることができるか?
  • RQ2トランスフォーマー基盤のコストボリューム精緻化は、標準的な類似度ベースの手法に比べてより良い深度予測をもたらすか?
  • RQ3学習されたアテンションベースのマッチング関数は、異なるデータセット間で効果的に転送可能か?
  • RQ4自己教師付きマルチフレーム手法は、教師あり単フレームアーキテクチャをどの程度上回ることができるか?
  • RQ5単一フレーム特徴の統合は、低信頼度または曇りのある領域での耐性をどの程度向上させるか?

主な発見

  • DepthFormerは自己教師付き単眼深度推定においてKITTIおよびDDADベンチマークで最先端の性能を達成した。
  • 本モデルは既存の自己教師付きマルチフレーム手法を上回り、BTSのようないくつかの教師あり単フレームアーキテクチャをも凌駒した。
  • KITTIでは、半分解像度(640×192)ではBTSと同等の結果を達成し、フル解像度(1216×352)ではそれを上回った。
  • 学習されたアテンションベースのマッチング関数は、データセット間で強く転送可能であり、事前学習中の収束を加速し、メモリ使用量を削減した。
  • 定性的な結果では、いかなる教師付き深度情報がなくても、低テクスチャ領域や動的領域においても正確な点群と深度マップの再構成が可能であることを示した。
  • 本手法は低信頼度領域(例:空、オクルージョン)を効果的にマスクし、単一フレーム特徴とのコンテキストに依存した統合によって回復した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。