Skip to main content
QUICK REVIEW

[논문 리뷰] GraftNet: Towards Domain Generalized Stereo Matching with a Broad-Spectrum and Task-Oriented Feature

Biyang Liu, Huimin Yu|arXiv (Cornell University)|2022. 04. 01.
Advanced Vision and Imaging인용 수 5
한 줄 요약

이 논문은 도메인 일반화된 스테레오 매칭 프레임워크인 GraftNet을 제안한다. 이는 코사인 유사도 기반의 비용 볼륨을 통해 ImageNet 사전 훈련 모델에서 유도한 광범위한 스펙트럼 특징을 스테레오 매칭 네트워크에 접목시켜 일반화 성능을 향상시킨다. 특징 추출과 비용 집계를 분리하고 경량 어댑터를 통해 접목된 특징을 보완함으로써, GraftNet은 타겟 도메인에서의 미세조정 없이도 KITTI 2015, KITTI 2012, Middlebury 및 ETH3D에서 최신 기준 성능을 달성한다.

ABSTRACT

Although supervised deep stereo matching networks have made impressive achievements, the poor generalization ability caused by the domain gap prevents them from being applied to real-life scenarios. In this paper, we propose to leverage the feature of a model trained on large-scale datasets to deal with the domain shift since it has seen various styles of images. With the cosine similarity based cost volume as a bridge, the feature will be grafted to an ordinary cost aggregation module. Despite the broad-spectrum representation, such a low-level feature contains much general information which is not aimed at stereo matching. To recover more task-specific information, the grafted feature is further input into a shallow network to be transformed before calculating the cost. Extensive experiments show that the model generalization ability can be improved significantly with this broad-spectrum and task-oriented feature. Specifically, based on two well-known architectures PSMNet and GANet, our methods are superior to other robust algorithms when transferring from SceneFlow to KITTI 2015, KITTI 2012, and Middlebury. Code is available at https://github.com/SpadeLiu/Graft-PSMNet.

연구 동기 및 목표

  • 합성 데이터로 훈련된 모델이 실제 이미지에서 성능이 떨어지는 도메인 이동 문제를 해결하기 위해.
  • 대규모 사전 훈련 모델에서 유도한 광범위한 스펙트럼 특징이 스테레오 매칭의 교차 도메인 일반화에 기여할 수 있는지 조사하기 위해.
  • 특징 추출과 비용 집계를 분리하여 모듈식이고, 미세조정 없이도 특징 접목이 가능한 아키텍처를 구현하기 위해.
  • 경량 어댑터 네트워크를 사용해 일반 목적 특징에서 작업에 특화된 정보를 복구하기 위해.
  • 훈련 시 타겟 도메인의 애너테이션을 필요로 하지 않고 도메인 일반화를 달성하기 위해.

제안 방법

  • ImageNet 사전 훈련 모델(예: VGG, ResNet)에서 유도한 광범위한 스펙트럼 특징을 스테레오 매칭 네트워크의 비용 집계 모듈에 접목시키기.
  • 특징 간 코사인 유사도를 사용해 일반화된 비용 볼륨을 구성함으로써 척도 불변성 확보 및 의미 간섭 제거.
  • 접목된 특징을 비용 계산 이전에 보완하기 위해 얕은, 작업에 특화된 어댑터 네트워크를 사용해 작업 관련성을 향상.
  • 어댑터는 소스 도메인(예: SceneFlow)에서만 훈련하여 광범위한 스펙트럼 특징의 강건성을 활용해 과적합을 줄임.
  • Graft-PSMNet와 Graft-GANet를 구성하기 위해 접목된 특징과 개선된 특징을 PSMNet 및 GANet 아키텍처에 통합.
  • 임의의 채널 수를 가진 특징을 스칼라 비용 볼륨으로 투영하기 위해 코사인 유사도를 사용해 다양한 특징과의 호환성 확보.
Figure 1 : The toy experiment to validate the grafting operation. Two models with the cost volume formed by feature concatenation (Subfigure c ) and cosine similarity (Subfigure e ) are trained on SceneFlow, then their feature extraction modules are replaced with a B road- S pectrum feature (Subfigu
Figure 1 : The toy experiment to validate the grafting operation. Two models with the cost volume formed by feature concatenation (Subfigure c ) and cosine similarity (Subfigure e ) are trained on SceneFlow, then their feature extraction modules are replaced with a B road- S pectrum feature (Subfigu

실험 결과

연구 질문

  • RQ1대규모 사전 훈련 모델에서 유도한 광범위한 스펙트럼 특징이 스테레오 매칭의 도메인 일반화에 기여할 수 있는가?
  • RQ2코사인 유사도를 사용한 비용 볼륨 구성이 사전 훈련된 특징을 미세조정 없이 효과적으로 접목하는 데 기여하는가?
  • RQ3경량 어댑터 네트워크가 일반 목적 특징에서 작업에 특화된 정보를 복구해 스테레오 매칭 성능을 향상시킬 수 있는가?
  • RQ4GraftNet은 다양한 실제 도메인 데이터셋에서 기존의 강력한 및 도메인 일반화된 스테레오 매칭 방법들과 비교해 어떻게 성능을 내는가?
  • RQ5특이한 이미지 스타일을 가진 데이터셋(예: ETH3D)에서 접목된 특징이 도메인 이동 문제를 다루는 데에는 어떤 한계를 가질 수 있는가?

주요 결과

  • Graft-PSMNet와 Graft-GANet는 KITTI 2015, KITTI 2012, Middlebury에서 각각 5.3% 및 5.4%의 3픽셀 오차율로 최신 기준 성능을 달성하며, 다른 강력한 방법들을 능가한다.
  • ETH3D에서는 각각 10.7% 및 6.2%의 3픽셀 오차율을 기록했지만, ImageNet에서 회색조 이미지 표현이 제한적이기 때문에 성능이 낮게 나타났다.
  • 코사인 유사도 기반 비용 볼륨을 사용함으로써 다양한 모델(예: ResNet18, ResNet50, OFE)의 특징을 효과적으로 접목할 수 있었으며, 일관된 성능 향상가능성이 확인되었다.
  • 미세조정 없이도 특징 접목이 직접적인 특징 교체보다 교차 도메인 성능 향상에 뚜렷하게 기여함으로써, 일반화된 비용 공간의 효과성을 입증했다.
  • 색상 왜곡 등의 데이터 증강 기법을 결합한 Graft-PSMNet와 Graft-GANet는 KITTI 2015에서 각각 4.8% 및 4.9%의 3픽셀 오차율을 기록해 더욱 향상된 성능을 달성했다.
  • 광범위한 스펙트럼 특징은 타겟 도메인 애너테이션 없이도 효과적으로 활용될 수 있으며, 진정한 도메인 일반화를 가능하게 함을 입증했다.
Figure 2 : The overall architecture of GraftNet, consisting of a broad-spectrum feature, a feature adaptor, and a cost aggregation module. To build GraftNet, we first graft the feature from a classic model trained on the large-scale dataset ImageNet to the cost aggregation module of an ordinary ster
Figure 2 : The overall architecture of GraftNet, consisting of a broad-spectrum feature, a feature adaptor, and a cost aggregation module. To build GraftNet, we first graft the feature from a classic model trained on the large-scale dataset ImageNet to the cost aggregation module of an ordinary ster

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.