Skip to main content
QUICK REVIEW

[논문 리뷰] TransMVSNet: Global Context-aware Multi-view Stereo Network with Transformers

Yikang Ding, Wentao Yuan|arXiv (Cornell University)|2021. 11. 29.
Advanced Vision and Imaging인용 수 13
한 줄 요약

TransMVSNet는 자기 주의 및 상호 주의 메커니즘을 활용하여 뷰 내외에서 장거리 전역적 맥락을 포착하는 기능 매칭 트랜스포머(FMT)를 활용하는 새로운 엔드 투 엔드 다중 시야 스테레오 네트워크를 제안한다. 적응형 수용장역할(ARF) 모듈과 변환된 특징 경로를 통합함으로써 효과적인 특징 정제 및 기울기 흐름을 가능하게 하여 DTU, Tanks and Temples, BlendedMVS 벤치마크에서 최신 기술 수준의 성능을 달성하며, BlendedMVS에서 0.73 EPE를 기록한다.

ABSTRACT

In this paper, we present TransMVSNet, based on our exploration of feature matching in multi-view stereo (MVS). We analogize MVS back to its nature of a feature matching task and therefore propose a powerful Feature Matching Transformer (FMT) to leverage intra- (self-) and inter- (cross-) attention to aggregate long-range context information within and across images. To facilitate a better adaptation of the FMT, we leverage an Adaptive Receptive Field (ARF) module to ensure a smooth transit in scopes of features and bridge different stages with a feature pathway to pass transformed features and gradients across different scales. In addition, we apply pair-wise feature correlation to measure similarity between features, and adopt ambiguity-reducing focal loss to strengthen the supervision. To the best of our knowledge, TransMVSNet is the first attempt to leverage Transformer into the task of MVS. As a result, our method achieves state-of-the-art performance on DTU dataset, Tanks and Temples benchmark, and BlendedMVS dataset. The code of our method will be made available at https://github.com/MegviiRobot/TransMVSNet .

연구 동기 및 목표

  • 텍스처가 없거나 반복적인 영역에서 국소적 특징 표현의 한계로 인해 깊이 추정이 어려운 점을 해결하기 위해.
  • 이미지 내외에서 장거리 전역적 맥락을 명시적으로 모델링하여 다중 시야 스테레오의 특징 매칭을 향상시키기 위해.
  • 효율적인 감독과 낮은 메모리 오버헤드를 갖춘 트랜스포머 기반 MVS 네트워크의 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 표준 이미지 매칭 작업과는 달리 MVS의 일대다 매칭 특성에 맞게 트랜스포머를 적응시키는 데 도전 과제를 극복하기 위해.

제안 방법

  • 각 이미지 내부에서 전역 맥락을 집계하기 위한 인트라 주의(intra-attention)와 모든 소스 이미지 간의 상호 주의(cross-view) 대응을 모델링하기 위한 인터 주의(inter-attention)를 사용하는 기능 매칭 트랜스포머(FMT)를 제안한다.
  • 국소적으로 집계된 CNN 특징에서 전역 수용장역할 FMT 특징으로 부드럽게 전이할 수 있도록 하는 적응형 수용장역할(ARF) 모듈을 도입하여 다양한 해상도 간의 특징 일관성을 확보한다.
  • 다양한 해상도 단계 간에 중간 특징과 기울기를 전달하기 위해 변환된 특징 경로를 활용하여 효율적인 코arse-to-fine 정제를 가능하게 한다.
  • 참조 및 소스 특징 맵 간의 매칭 비용을 계산하기 위해 쌍별 특징 상관관계를 사용하여 대응 추정을 향상시킨다.
  • 특히 모호하거나 어려운 영역에서 예측이 어려운 픽셀에 대한 감독을 향상시키기 위해 모호성 감소 초점 손실(focal loss)을 적용한다.
  • 다단계 깊이 예측과 깊이 가설의 점진적 정제를 통한 코arse-to-fine 정규화 전략을 채택한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 다중 시야 스테레오 매칭에 대해 장거리 전역 맥락을 효과적으로 모델링할 수 있는가, 특히 도전적인 영역에서 깊이 추정 성능을 향상시키는가?
  • RQ2트랜스포머의 자기 주의 및 상호 주의 메커니즘은 표준 이미지 매칭 작업과는 달리 MVS의 일대다 매칭 특성에 어떻게 적응시킬 수 있는가?
  • RQ3고효율성과 낮은 메모리 오버헤드를 갖춘 트랜스포머 기반 MVS 네트워크의 엔드 투 엔드 학습을 가능하게 하기 위해 필요한 아키텍처 구성 요소는 무엇인가?
  • RQ4FMT를 통한 전역 맥락 통합이 표준 MVS 벤치마크에서 깊이 정확도 및 완전성에 측정 가능한 향상을 가져오는가?

주요 결과

  • TransMVSNet은 BlendedMVS 검증 세트에서 평균 오차(EPE) 0.73을 기록하여 CasMVSNet(1.43 EPE) 및 EPP-MVSNet(1.17 EPE)와 같은 이전 방법들을 크게 능가한다.
  • DTU 데이터셋에서 TransMVSNet은 EPE 0.73을 달성하여 기준 모델인 CasMVSNet(1.43 EPE) 대비 48%의 상대적 향상을 기록하며 이 벤치마크에서 새로운 최신 기술 수준을 수립한다.
  • Tanks and Temples 벤치마크에서 TransMVSNet은 복잡한 실제 환경 영역에 대해 강력한 일반화 성능을 보이며 최신 기술 수준의 성능를 달성한다.
  • 단절 실험 결과는 Focal Loss, FMT, ARF, 변환된 특징 경로 등 각 구성 요소가 성능 향상에 기여하며, 전체 모델은 DTU에서 총 정확도 0.305를 기록함을 확인한다.
  • ARF 모듈은 계산 비용을 증가시키지만 더 나은 특징 적응을 가능하게 하며, 변환된 경로는 최소한의 메모리 오버헤드로 성능 향상을 이룬다.
  • 기본 모델 대비 1.4배의 추론 속도 저하가 발생하지만, 전체 모델은 이미지당 1초 이내로 실행되어 실세계 적용에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.