Skip to main content
QUICK REVIEW

[논문 리뷰] OpenStereo: A Comprehensive Benchmark for Stereo Matching and Strong Baseline

Xianda Guo, Chenming Zhang|arXiv (Cornell University)|2023. 12. 01.
Advanced Vision and Imaging인용 수 6
한 줄 요약

이 논문은 스테레오 매칭을 위한 종합적이고 오픈소스 기반의 벤치마크 및 코드베이스인 OpenStereo를 소개한다. 이는 12개 이상의 스테레오 매칭 모델에 대한 훈련 및 추론을 지원한다. 또한, 단순하면서도 매우 효과적인 백본 모델인 StereoBase를 제안하여 SceneFlow 데이터셋에서 엔드 투 엔드(EPE) 성능 0.43의 새로운 최고 성능을 달성한다. 이는 체계적인 아블레이션 및 모델 설계 최적화를 통해 강력한 성능을 입증한다.

ABSTRACT

Stereo matching aims to estimate the disparity between matching pixels in a stereo image pair, which is important to robotics, autonomous driving, and other computer vision tasks. Despite the development of numerous impressive methods in recent years, determining the most suitable architecture for practical application remains challenging. Addressing this gap, our paper introduces a comprehensive benchmark focusing on practical applicability rather than solely on individual models for optimized performance. Specifically, we develop a flexible and efficient stereo matching codebase, called OpenStereo. OpenStereo includes training and inference codes of more than 10 network models, making it, to our knowledge, the most complete stereo matching toolbox available. Based on OpenStereo, we conducted experiments and have achieved or surpassed the performance metrics reported in the original paper. Additionally, we conduct an exhaustive analysis and deconstruction of recent developments in stereo matching through comprehensive ablative experiments. These investigations inspired the creation of StereoBase, a strong baseline model. Our StereoBase ranks 1st on SceneFlow, KITTI 2015, 2012 (Reflective) among published methods and achieves the best performance across all metrics. In addition, StereoBase has strong cross-dataset generalization. Code is available at \url{https://github.com/XiandaGuo/OpenStereo}.

연구 동기 및 목표

  • 다양한 아키텍처와 데이터셋 간에 스테레오 매칭 모델을 재현하고 비교할 수 있는 통합적이고 확장 가능한 플랫폼의 부족 문제를 해결하기 위해.
  • 데이터 증강, 백본 네트워크, 코스트 볼륨 설계, 손실 함수와 같은 스테레오 매칭의 핵심 구성 요소에 대한 체계적인 아블레이션 연구를 가능하게 하기 위해.
  • 기존 방법보다 정확도와 효율성 측면에서 뛰어난 성능을 내는 단순하고 일반화 가능한 백본 모델을 확립하기 위해.
  • 표준화된, 철저히 문서화된 코드베이스를 통해 최신 스테레오 매칭 방법 간의 실질적 배포 및 공정한 비교를 촉진하기 위해.

제안 방법

  • 12개 이상의 스테레오 매칭 모델(엔코더-디코더(ED-Conv2D) 및 코스트 볼륨 매칭(CVM-Conv3D) 아키텍처 포함)에 대한 훈련 및 추론을 지원하는 확장성 있고 모듈식인 코드베이스인 OpenStereo를 개발하였다.
  • 아블레이션을 통해 최적화된 종합적인 데이터 증강 기법—RandomCrop 및 Erase Transform—을 구현하여 모델의 일반화 능력과 강건성을 향상시켰다.
  • 1/4 해상도에서 특징 추출을 위한 MobileNetV2 백본을 사용하고, 그룹별 상관관계(8채널)와 연결(16채널)을 조합한 하이브리드 코스트 볼륨을 설계하여 정확도와 효율성의 균형을 확보한 StereoBase를 설계하였다.
  • 코스트 볼륨 집계를 위해 아워가스 네트워크를, 디스parity 회귀를 위해 컨텍스트 업샘플링 모듈을 사용하였고, 최종 보정을 위해 DRNetRefine을 적용하였다.
  • 안정적이고 정확한 엔드 투 엔드 학습을 보장하기 위해 최대 디스파리티 192를 사용한 스무스 L1 손실 함수를 적용하였다.
  • 최종 StereoBase 설계를 이끌기 위해 SceneFlow 데이터셋에서 광범위한 아블레이션 연구를 수행하였다.

실험 결과

연구 질문

  • RQ1스테레오 매칭에서 데이터 증강, 백본 아키텍처, 코스트 볼륨 구성, 손실 함수의 가장 효과적인 조합은 무엇인가?
  • RQ22D 및 3D 컨벌루션, 네트워크 깊이 등의 다양한 아키텍처 선택이 정확도와 추론 효율성 간의 트레이드오프에 어떻게 영향을 미치는가?
  • RQ3체계적인 아블레이션 및 설계 최적화를 통해 단순하고 경량화된 모델이 최고 성능을 달성할 수 있는가?
  • RQ4기존 최고 수준의 방법들이 표준화된 훈련 및 평가 프로토콜을 통해 얼마나 유의미한 이점을 얻을 수 있는가?

주요 결과

  • StereoBase는 SceneFlow 테스트 세트에서 엔드 투 엔드(EPE) 성능 0.43을 기록하여 이전에 보고된 결과를 초월하는 새로운 최고 성능을 달성하였다.
  • 아블레이션 연구 결과, RandomCrop 및 Erase Transform이 다양한 스테레오 매칭 시나리오에서 모델의 강건성과 일반화 능력을 크게 향상시켰다.
  • 그룹별 상관관계와 연결을 조합한 하이브리드 코스트 볼륨 설계는 계산 비용과 디스파리티 추정 정확도 사이의 최적의 트레이드오프를 제공하였다.
  • StereoBase는 여러 복잡한 최고 수준의 모델들을 압도하여, 아키텍처의 단순성과 체계적인 구성 요소 최적화가 뛰어난 성능을 이끌어낼 수 있음을 입증하였다.
  • OpenStereo 플랫폼은 12개 이상의 모델에 대한 일관되고 재현 가능한 평가를 성공적으로 수행하여, 벤치마킹 프레임워크로서의 유용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.