Skip to main content
QUICK REVIEW

[論文レビュー] CFNet: Cascade and Fused Cost Volume for Robust Stereo Matching

Zhelun Shen, Yuchao Dai|arXiv (Cornell University)|Apr 9, 2021
Advanced Vision and Imaging参考文献 25被引用数 13
ひとこと要約

CFNetは、多様なデータセットにわたるステレオマッチングの頑健性を向上させるために、段階的で融合されたコストボリュームネットワークを提案する。低解像度のコストボリュームを統合してグローバルな文脈を捉え、段階的な構造で分散度に基づく不確実性推定を用いて不一致の探索範囲を動的に精錬することで、ドメイン特化のない単一モデルとしてKITTI、ETH3D、Middleburyで最先端の一般化性能を達成した。

ABSTRACT

Recently, the ever-increasing capacity of large-scale annotated datasets has led to profound progress in stereo matching. However, most of these successes are limited to a specific dataset and cannot generalize well to other datasets. The main difficulties lie in the large domain differences and unbalanced disparity distribution across a variety of datasets, which greatly limit the real-world applicability of current deep stereo matching models. In this paper, we propose CFNet, a Cascade and Fused cost volume based network to improve the robustness of the stereo matching network. First, we propose a fused cost volume representation to deal with the large domain difference. By fusing multiple low-resolution dense cost volumes to enlarge the receptive field, we can extract robust structural representations for initial disparity estimation. Second, we propose a cascade cost volume representation to alleviate the unbalanced disparity distribution. Specifically, we employ a variance-based uncertainty estimation to adaptively adjust the next stage disparity search space, in this way driving the network progressively prune out the space of unlikely correspondences. By iteratively narrowing down the disparity search space and improving the cost volume resolution, the disparity estimation is gradually refined in a coarse-to-fine manner. When trained on the same training images and evaluated on KITTI, ETH3D, and Middlebury datasets with the fixed model parameters and hyperparameters, our proposed method achieves the state-of-the-art overall performance and obtains the 1st place on the stereo task of Robust Vision Challenge 2020. The code will be available at https://github.com/gallenszl/CFNet.

研究の動機と目的

  • 大規模なドメインシフトを伴う多様なデータセットにわたるステレオマッチングモデルの一般化性能の低さという課題に対処すること。
  • KITTIとMiddleburyの間で不均衡な不一致分布が生じるが、これによりモデルの移行性が損なわれるのを克服すること。
  • 微調整なしに複数の実世界データセットで良好に動作する、固定ハイパーパrameterを有する単一モデルを開発すること。
  • ドメインシフト(例:屋内 vs 屋外、合成 vs 実データ)および不一致範囲の変動に対する頑健性を向上させること。
  • 粗〜細かい段階的で適応的な精錬フレームワークにおいて、高い性能を維持しながら計算効率を確保すること。

提案手法

  • 複数の低解像度の密なコストボリュームを統合して、有効な受容 field を拡大し、グローバルな構造的特徴を捉える融合コストボリュームを導入すること。
  • 融合コストボリュームを用いて、ドメインシフトに対して不変な、頑健な初期不一致推定値を生成すること。
  • 各段階で探索範囲を狭めるように段階的に不一致推定値を精錬する段階的コストボリューム構造を提案すること。
  • 分散に基づく不確実性推定を用いて、各段階でピクセル単位の信頼度を動的に評価し、不適切な不一致候補を除外すること。
  • 不確実性スコアに基づいて、次の段階での不一致探索範囲を適応的に調整することで、効率的で的を射た精錬を可能にすること。
  • すべてのデータセットでモデルパラメータとハイパーパrameterを固定したままにし、適応なしにゼロショット一般化を実現すること。

実験結果

リサーチクエスチョン

  • RQ1単一の固定モデルを用いて、KITTI、ETH3D、Middleburyといった複数の多様なデータセットで最先端の性能を達成できるか?
  • RQ2コストボリューム表現をどのように強化すれば、データセット間のドメインシフトに対する頑健性が向上するか?
  • RQ3不一致探索範囲の適応的かつ不確実性駆動の精錬が、不均衡な不一致分布における性能向上にどの程度寄与するか?
  • RQ4融合および段階的コストボリューム設計により、データセット特化の微調整に依存するのを軽減しながら、正確性を維持または向上できるか?
  • RQ5提案手法は、ドメイン特化またはマルチドメイン事前学習モデルと比較して、クロスドメイン設定においてより優れた一般化性能を示すか?

主な発見

  • CFNetは、Robust Vision Challenge 2020のステレオマッチングタスクで、KITTI、ETH3D、Middleburyの3データセットで最先端の一般化性能を達成し、1位を獲得した。
  • KITTI 2015では、D1_all誤差率が1.88%に達し、ベースモデルのCasstereo(2.00%)を上回り、GANet-deep や ACFNet と同等の性能(6%の誤差低減、3倍速い推論)を達成した。
  • ETH3Dでは、最高のパフォーマンス(1位)を記録し、GANet や HSMNet といったドメイン特化モデルを大きく上回った。
  • Middleburyでは、全体で2位を獲得し、多くのモデルが失敗する高解像度の屋内シーンでも強力な性能を示した。
  • DSMnet といったドメイン一般化手法をすべての3データセットで上回り、融合および段階的コストボリューム設計の有効性を裏付けた。
  • リアルタイム評価では、KITTI 2012 および KITTI 2015 ベンチマークの両方で200ms未満の速度を達成するすべての手法を上回り、その効率性と実用性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。