Skip to main content
QUICK REVIEW

[논문 리뷰] AdaStereo: A Simple and Efficient Approach for Adaptive Stereo Matching

Xiao Song, Guorun Yang|arXiv (Cornell University)|2020. 04. 09.
Advanced Vision and Imaging참고 문헌 95인용 수 14
한 줄 요약

AdaStereo는 종합적인 도메인 적응 파이프라인을 제안하며, 입력 이미지(비대칭적 점진적 색상 이행을 통한), 내부 특징(파rameter-free 비용 정규화를 통한), 출력 차이(자기지도형 망막 인식 재구성 기반) 수준에서 합성 및 실세계 도메인 간 특징을 정렬한다. 이 방법은 타겟 도메인 진짜값에 대한 미세조정 없이 KITTI, Middlebury, ETH3D, DrivingStereo에서 최고의 교차 도메인 성능을 달성한다.

ABSTRACT

Recently, records on stereo matching benchmarks are constantly broken by end-to-end disparity networks. However, the domain adaptation ability of these deep models is quite poor. Addressing such problem, we present a novel domain-adaptive pipeline called AdaStereo that aims to align multi-level representations for deep stereo matching networks. Compared to previous methods for adaptive stereo matching, our AdaStereo realizes a more standard, complete and effective domain adaptation pipeline. Firstly, we propose a non-adversarial progressive color transfer algorithm for input image-level alignment. Secondly, we design an efficient parameter-free cost normalization layer for internal feature-level alignment. Lastly, a highly related auxiliary task, self-supervised occlusion-aware reconstruction is presented to narrow down the gaps in output space. Our AdaStereo models achieve state-of-the-art cross-domain performance on multiple stereo benchmarks, including KITTI, Middlebury, ETH3D, and DrivingStereo, even outperforming disparity networks finetuned with target-domain ground-truths.

연구 동기 및 목표

  • 합성 데이터로 훈련된 엔드 투 엔드 스테레오 매칭 네트워크의 열악한 도메인 일반화 문제를 해결하기 위해.
  • 합성(예: SceneFlow)과 실세계(예: KITTI, Middlebury) 스테레오 데이터셋 간의 도메인 갭을 입력, 내부 특징, 출력 차이 수준에서 식별하고 보완하기 위해.
  • GAN 유도 왜곡을 피하고 타겟 도메인 애너테이션 의존도를 줄이며, 비대칭적이고 효율적인 스테레오 매칭을 위한 완전한 도메인 적응 파이프라인을 개발하기 위해.
  • 타겟 도메인 진짜값에 대한 어떤 미세조정 없이도 합성 데이터만으로 사전훈련한 상태에서 실세계 벤치마크에서 최고의 성능을 달성하기 위해.

제안 방법

  • 합성(소스) 도메인과 실세계(타겟) 도메인 간 입력 색상 분포를 훈련 중에 비대칭적 점진적 색상 이행 알고리즘으로 정렬하여 GAN 유도 기하 왜곡을 피한다.
  • 채널 및 픽셀 수준 정규화를 적용함으로써 내부 매칭 비용 볼륨을 정규화하는 파rameter-free 비용 정규화 레이어를 도입하여 도메인 간 특징 일관성 향상.
  • 장애물 마스크 예측을 동시에 수행하면서 타겟 도메인 이미지를 재구성함으로써 출력 차이 지도를 정렬하는 자기지도형 장애물 인식 재구성 작업을 사용하여 기하 일관성 향상.
  • 장애물 영역에서 재구성의 불완전한 성질을 해결하기 위해 소스 및 타겟 도메인을 함께 훈련함으로써 도메인 협업 학습 전략을 도입하여 장애물 마스크 예측 성능 향상.
  • 전체 파이프라인을 표준 스테레오 매칭 네트워크(예: PSMNet)에 통합하여 최소한의 아키텍처 변경으로 엔드 투 엔드 훈련이 가능하게 한다.
  • SceneFlow에서의 사전훈련에 의존하여 타겟 도메인의 미세조정 없이도 여러 벤치마크에서 평가한다.

실험 결과

연구 질문

  • RQ1비대칭적이고 점진적인 색상 이행 방법은 기하 왜곡 없이 입력 수준의 도메인 갭을 효과적으로 정렬할 수 있는가?
  • RQ2학습 가능한 파rameter 없이 합성 및 실세계 도메인 간 내부 특징 분포(비용 볼륨)를 어떻게 정규화할 수 있는가?
  • RQ3자기지도형 장애물 인식 재구성 작업은 출력 공간 정렬을 향상시키고 교차 도메인 차이 지도 예측 정확도를 높일 수 있는가?
  • RQ4입력, 특징, 출력 수준 정렬을 통합하면 기존의 도메인 일반화 또는 적응 방법에 비해 실세계 스테레오 벤치마크에서 더 뛰어난 일반화 성능을 달성할 수 있는가?
  • RQ5합성 데이터로 사전훈련한 도메인 적응 스테레오 모델이 실세계 진짜값 애너테이션으로 미세조정된 모델보다 성능이 뛰어날 수 있는가?

주요 결과

  • AdaStereo는 ETH3D 벤치마크에서 타겟 도메인 미세조정 없이도 2픽셀 오차 지표에서 1위를 기록하여 최고의 성능을 달성했다.
  • Middlebury 벤치마크에서 SceneFlow로 사전훈련한 Ada-PSMNet는 2픽셀 오차율 13.7%를 기록하여 PSMNet, iResNet, EdgeStereo를 포함한 모든 미세조정된 엔드 투 엔드 스테레오 네트워크를 초월했다.
  • KITTI 2015 벤치마크에서 Ada-PSMNet는 D1 오차율 3.08%를 기록하여 비지도 및 약한 지도 학습 방법을 뛰어넘고 KITTI에 대해 미세조정된 GC-Net의 성능과도 동등했다.
  • 절단 실험 결과, 색상 이행, 비용 정규화, 장애물 인식 재구성의 세 가지 구성 요소 모두 최종 성능 향상에 기여하며, 특히 재구성 모듈이 가장 큰 기여를 했다.
  • 평가된 모든 벤치마크에서 도메인 일반화 기반 모델뿐 아니라 타겟 도메인 진짜값으로 미세조정된 모델보다도 성능이 뛰어나, 강력한 제로샷 도메인 적응 능력을 입증했다.
  • 자기지도형 장애물 인식 재구성 모듈은 명시적 애너테이션 없이도 실세계 데이터의 시나리오 기하학을 훈련 중에 통합함으로써 차이 지도 예측 성능을 효과적으로 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.