Skip to main content
QUICK REVIEW

[論文レビュー] Content-Aware Inter-Scale Cost Aggregation for Stereo Matching

Chengtang Yao, Yunde Jia|arXiv (Cornell University)|Jun 5, 2020
Advanced Vision and Imaging参考文献 37被引用数 5
ひとこと要約

本稿では、ステレオマッチングのためのコンテンツに適応したスケール間コスト集約手法を提案する。この手法は、左・右の視点から動的フィルタ重みを学習し、スケール間でコストボリュームを動的かつ適応的にアップサンプリング・集約することで、優れた細部回復を実現する。空間的関係を明示的に符号化し、3次元集約を2次元および1次元の演算に分解することで、計算量を削減しながら、Scene Flow、KITTI2015、Middleburyデータセットで最先端の手法を上回る性能を達成する。

ABSTRACT

Cost aggregation is a key component of stereo matching for high-quality depth estimation. Most methods use multi-scale processing to downsample cost volume for proper context information, but will cause loss of details when upsampling. In this paper, we present a content-aware inter-scale cost aggregation method that adaptively aggregates and upsamples the cost volume from coarse-scale to fine-scale by learning dynamic filter weights according to the content of the left and right views on the two scales. Our method achieves reliable detail recovery when upsampling through the aggregation of information across different scales. Furthermore, a novel decomposition strategy is proposed to efficiently construct the 3D filter weights and aggregate the 3D cost volume, which greatly reduces the computation cost. We first learn the 2D similarities via the feature maps on the two scales, and then build the 3D filter weights based on the 2D similarities from the left and right views. After that, we split the aggregation in a full 3D spatial-disparity space into the aggregation in 1D disparity space and 2D spatial space. Experiment results on Scene Flow dataset, KITTI2015 and Middlebury demonstrate the effectiveness of our method.

研究の動機と目的

  • 粗いスケールでの処理中に失われた微細なディテールを回復できない固定アップサンプリング手法の限界を解消すること。
  • 単一視点のガイドに依存するのではなく、左・右の視点特徴を活用してコンテンツに適応した重み学習を行うことで、コスト集約の品質を向上させること。
  • 3次元コストボリューム集約における計算コストを削減するため、完全な3次元演算を分解可能な2次元および1次元コンponentsに分離すること。
  • ステレオ視点間の類似性に基づいて動的かつコンテンツに適応したフィルタ重みを学習することで、アップサンプリング時に信頼性の高いディテール回復を実現すること。

提案手法

  • 本手法は、異なるスケールにおける左・右の視点からのペアド特徴マップを用いて、特徴マップのシフトと位置マップを介して空間的関係を明示的に符号化することで、コンテンツに適応したフィルタ重みを学習する。
  • 大径の受容 field を使用する代わりに、シフトされた特徴マップと位置マップを連結して1×1畳み込み層の入力とすることで、空間的関係の明示的符号化を導入する。
  • 3次元コストボリューム集約を2次元空間的類似度学習と1次元の不一致に基づくワーピングに分解する、新規な分解戦略を提案し、メモリおよび計算量を顕著に削減する。
  • 直接的な3次元重み学習を回避するため、不一致に適応したワーピングを用いて学習された2次元類似度から、オンザフライで3次元フィルタ重みを構築する。
  • 従来の手法が深さや大きなカーネルを必要とするのに対し、本手法は重み生成に1×1畳み込みのみを用いるため、計算効率が向上する。
  • PSMNetベースのフレームワークに統合され、標準的なデコンボリューションや補間の代わりに、学習された適応的アップサンプリングが採用される。

実験結果

リサーチクエスチョン

  • RQ1ステレオ視点ペアを有効に活用することで、単一視点のガイドに比べて、スケール間コスト集約のためのコンテンツに適応した重みを学習し、ディテール回復を向上させることができるか?
  • RQ2左・右の視点間のピクセル間の空間的関係を明示的に符号化することで、大受容域を持つ畳み込みによる暗黙的符号化に比べ、性能および効率が向上するか?
  • RQ33次元コストボリューム集約を、精度を損なわずに2次元および1次元の演算に効率的に分解できるか?
  • RQ4固定重みのアップサンプリング(例:バイリニア補間やデコンボリューション)と比較して、本手法は不一致推定における微細なディテールをどれほど効果的に保持できるか?

主な発見

  • Middlebury-v3データセットでは、比較対象の全手法の中で最高の性能を達成し、EPE指標で59.7%の誤差率を記録。PSMNet-ROB(67.3%)およびDeepPruner-ROB(57.1%)を上回った。
  • 計算コストを顕著に削減した:0.28 GFLOPsの推論コストを達成し、PSMNet-ROB(0.64 GFLOPs)およびAMNet(0.4 GFLOPs)を下回ったが、精度はさらに向上した。
  • KITTI2015では、EPE指標で13.7%の誤差率を記録し、PSMNet-ROB(23.5%)およびDeepPruner-ROB(15.9%)を上回り、精度の向上を示した。
  • Middlebury-v3における可視化結果から、特に他の手法がテクスチャーやエッジ構造を保持できない赤枠で囲まれた領域で、微細なディテール回復において明確な優位性が確認された。
  • アブレーションスタディの結果、空間的関係の明示的符号化およびステレオ視点に基づく重み学習の有効性が確認され、暗黙的符号化や単一視点ガイドに比べて顕著な性能向上が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。