[論文レビュー] Revisiting Stereo Depth Estimation From a Sequence-to-Sequence Perspective with Transformers
本稿では、トランスフォーマーを用いてコストボリュームの構築を置き換え、問題をシーケンス・ツー・シーケンスのマッチングタスクに再定式化するステレオ深度推定手法STTRを提案する。自己注意およびクロス注意を相対的位置符号化と組み合わせ、最適輸送に基づくマッチングを用いることで、柔軟な視差範囲推定、信頼性スコアを伴うオクルージョン検出、一意性制約の強制が可能となり、最小限のパラメータで、合成および実世界のベンチマークで最先端の性能を達成するとともに、優れたゼロショット一般化性能を示す。
Stereo depth estimation relies on optimal correspondence matching between pixels on epipolar lines in the left and right images to infer depth. In this work, we revisit the problem from a sequence-to-sequence correspondence perspective to replace cost volume construction with dense pixel matching using position information and attention. This approach, named STereo TRansformer (STTR), has several advantages: It 1) relaxes the limitation of a fixed disparity range, 2) identifies occluded regions and provides confidence estimates, and 3) imposes uniqueness constraints during the matching process. We report promising results on both synthetic and real-world datasets and demonstrate that STTR generalizes across different domains, even without fine-tuning.
研究の動機と目的
- ディープラーニングベースのステレオ深度推定における固定視差範囲制約の限界を克服すること。
- 一意性やオクルージョン検出といった幾何制約を組み込んだ、密度的なピクセル対応のエンド・ツー・エンド学習を可能にすること。
- 下流のシーン理解を向上させるために、視差予測の信頼性推定を提供すること。
- ファインチューニングなしでドメインを跨いで一般化可能な、メモリ効率の良いトランスフォーマー基盤アーキテクチャを開発すること。
- より高いロバストネスと柔軟性を実現するため、コストボリューム構築を注意ベースの密度的マッチングに置き換えること。
提案手法
- STTRは、左および右のステレオ画像から画像埋め込みを生成する共通の特徴抽出器を用いる。
- 交互に自己注意とクロス注意を適用するトランスフォーマーエンコーダーを用いて、エピポラーラインに沿った密度的かつ明示的なピクセル単位のマッチングを計算する。
- ピクセル間の相対的距離符号化を特徴記述子に組み込み、マッチングの識別能を向上させ、曖昧さを解消する。
- 最適輸送理論を用いてマッチングの一意性を強制し、3次元空間の同一ポイントに複数のピクセルが割り当てられるのを防ぐ。
- 文脈調整層が、エピポラーラインに沿った左画像からの文脈的情報を用いて、元の視差予測を精緻化する。
- メモリ効率の良い実装により、注意計算と特徴解像度の最適化によって、標準的なハードウェアでも学習が可能になる。
実験結果
リサーチクエスチョン
- RQ1固定視差範囲制約を緩和しつつ、シーケンス・ツー・シーケンスのトランスフォーマーに基づくアプローチが、コストボリュームベースの手法を上回ることができるか?
- RQ2相対的位置符号化を備えた注意メカニズムが、手作業で設計されたコストボリュームを効果的に置き換えられるか?
- RQ3追加の教師信号なしで、オクルージョン領域を検出し、信頼性推定値を提供できるか?
- RQ4ファインチューニングなしで、ドメイン(例:合成データから実世界データ)を跨いで一般化できるか?
- RQ5トランスフォーマー基盤アーキテクチャが、少ないパラメータ数と低いメモリ使用量で競争力のある性能を達成できるか?
主な発見
- STTRは、ドメイン固有のファインチューニングなしで、Scene Flow、MPI Sintel、KITTI 2015、Middlebury 2014、SCAREDベンチマークで最先端の性能を達成した。
- 合成データのScene Flowデータセットでのみ学習したモデルが、KITTI 2015 や Middlebury 2014 といった実世界データセットに対しても、効果的に一般化した。
- STTRは、Scene Flowで0.76 px、KITTI 2015で0.82 pxの中央絶対誤差を報告し、両方の指標で先行手法を上回った。
- モデルはたった250万パラメータで、視差推定ネットワークとしては最もパラメータ効率が良く、NAS最適化モデルであるLEAStereoでさえも上回った。
- PSMNet や AANet よりも顕著に低いメモリ使用量を実現し、最大視差192、960×576解像度の画像処理で3.8 GBのメモリ使用量にとどまった。
- 最大視差192、960×576解像度の環境下で、軽量バージョンでは2.0 GBのメモリ使用量で5.77 Hzの推論速度を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。