Skip to main content
QUICK REVIEW

[논문 리뷰] CFNet: Cascade and Fused Cost Volume for Robust Stereo Matching

Zhelun Shen, Yuchao Dai|arXiv (Cornell University)|2021. 04. 09.
Advanced Vision and Imaging참고 문헌 25인용 수 13
한 줄 요약

CFNet는 다양한 데이터셋에서 스테레오 매칭의 강인성을 향상시키기 위해 계단식 및 융합된 비용 영역 네트워크를 제안한다. 저해상도 비용 영역을 융합하여 전역적 맥락을 확보하고, 계단식 구조에서 분산 기반의 불확실성 추정을 사용하여 비틀림된 디스parity 검색 영역을 적응적으로 개선함으로써, 도메인 특화 보정 없이 KITTI, ETH3D, Middlebury에서 최신 기술 수준의 일반화 성능을 달성한다.

ABSTRACT

Recently, the ever-increasing capacity of large-scale annotated datasets has led to profound progress in stereo matching. However, most of these successes are limited to a specific dataset and cannot generalize well to other datasets. The main difficulties lie in the large domain differences and unbalanced disparity distribution across a variety of datasets, which greatly limit the real-world applicability of current deep stereo matching models. In this paper, we propose CFNet, a Cascade and Fused cost volume based network to improve the robustness of the stereo matching network. First, we propose a fused cost volume representation to deal with the large domain difference. By fusing multiple low-resolution dense cost volumes to enlarge the receptive field, we can extract robust structural representations for initial disparity estimation. Second, we propose a cascade cost volume representation to alleviate the unbalanced disparity distribution. Specifically, we employ a variance-based uncertainty estimation to adaptively adjust the next stage disparity search space, in this way driving the network progressively prune out the space of unlikely correspondences. By iteratively narrowing down the disparity search space and improving the cost volume resolution, the disparity estimation is gradually refined in a coarse-to-fine manner. When trained on the same training images and evaluated on KITTI, ETH3D, and Middlebury datasets with the fixed model parameters and hyperparameters, our proposed method achieves the state-of-the-art overall performance and obtains the 1st place on the stereo task of Robust Vision Challenge 2020. The code will be available at https://github.com/gallenszl/CFNet.

연구 동기 및 목표

  • 대규모 도메인 이동이 있는 다양한 데이터셋 간에 일반화 능력이 떨어지는 스테레오 매칭 모델의 과제를 해결한다.
  • KITTI와 Middlebury 간의 비균형적인 디스파리티 분포(예: KITTI 대비 Middlebury)로 인해 모델 이식성이 저하되는 문제를 해결한다.
  • 모델의 하이퍼파rameter를 고정한 채로 여러 실세계 데이터셋에서 테스트 없이도 잘 작동하는 단일 모델을 개발한다.
  • 도메인 이동(예: 실내 대비 실외, 합성 대비 실제) 및 디스파리티 범위 변화에 대한 강인성을 향상시킨다.
  • 粗-세밀한 구조에서 적응적 개선 프레임워크를 유지하면서도 계산 효율성을 확보한 채 높은 성능을 달성한다.

제안 방법

  • 다양한 저해상도 밀도 비용 영역을 융합하여 효과적이고 넓은 수신장치를 확보하고 전역적 구조적 특징을 포착하는 융합 비용 영역을 도입한다.
  • 융합 비용 영역를 사용하여 도메인 이동에 영향을 받지 않는 강건한 初기 디스파리티 추정치를 생성한다.
  • 각 단계에서 검색 영역을 좁혀가며 점진적으로 디스파리티 추정치를 개선하는 계단식 비용 영역 구조를 제안한다.
  • 분산 기반의 불확실성 추정을 사용하여 픽셀 단위의 신뢰도를 동적으로 평가하고 각 단계에서 가능성 없는 디스파리티 후보를 제거한다.
  • 불확실성 점수에 기반하여 이후 단계에서 디스파리티 검색 범위를 적응적으로 조정함으로써 효율적이고 집중적인 개선을 가능하게 한다.
  • 모든 데이터셋에서 고정된 모델 파rameter와 하이퍼파rameter를 유지함으로써 적응 없이 제로샷 일반화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1단일 고정 모델을 사용하여 KITTI, ETH3D, Middlebury와 같은 다양한 데이터셋에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2비용 영역 표현 방식을 어떻게 개선하여 데이터셋 간 도메인 이동에 대한 강인성을 향상시킬 수 있는가?
  • RQ3적응적이고 불확실성 기반의 디스파리티 검색 영역 개선이 비균형적인 디스파리티 분포에서 성능 향상에 얼마나 기여하는가?
  • RQ4융합 및 계단식 비용 영역 설계가 데이터셋 특화 보정에 의존도를 줄이면서도 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ5제안된 방법이 도메인 특화 또는 다중 도메인 사전학습 모델보다 교차 도메인 환경에서 더 나은 일반화 성능을 보일 수 있는가?

주요 결과

  • CFNet는 단일 고정 모델로 Robust Vision Challenge 2020 스테레오 매칭 과제에서 최우수 성과를 기록하며 KITTI, ETH3D, Middlebury 데이터셋에서 최신 기술 수준의 일반화 성능을 확보했다.
  • KITTI 2015에서 CFNet는 D1_all 오차율 1.88%를 기록하여 기본 모델인 Casstereo(2.00%)를 능가했으며, 6% 낮은 오차율과 3배 빠른 추론 속도로 GANet-deep 및 ACFNet와 동등한 성능을 내었다.
  • ETH3D에서 CFNet는 최고 성능(1위)을 기록했으며, GANet 및 HSMNet와 같은 도메인 특화 모델을 크게 앞섰다.
  • Middlebury에서 CFNet는 전체 2위를 기록했으며, 많은 모델이 실패하는 고해상도 실내 환경에서도 뛰어난 성능을 보였다.
  • CFNet는 모든 세 데이터셋에서 도메인 일반화 방법인 DSMnet를 뛰어넘었으며, 융합 및 계단식 비용 영역 설계의 효과성을 입증했다.
  • 실시간 평가에서 CFNet는 KITTI 2012 및 KITTI 2015 벤치마크에서 200ms 이내로 빠른 모든 방법보다 뛰어난 성능을 보였으며, 효율성과 실용성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.