Skip to main content
QUICK REVIEW

[논문 리뷰] Fast-MVSNet: Sparse-to-Dense Multi-View Stereo With Learned Propagation and Gauss-Newton Refinement

Zehao Yu, Shenghua Gao|arXiv (Cornell University)|2020. 03. 29.
Advanced Vision and Imaging참고 문헌 44인용 수 14
한 줄 요약

Fast-MVSNet는 3D 컨볼루션 네트워크를 사용해 먼저 희박한 고해상도 깊이 맵을 예측한 후, 연관 양자화된 이중 이중 필터링에 영감을 받은 학습 가능한 국소 전파 네트워크를 통해 이를 조밀하게 만들고, 마지막으로 가우시안-뉴턴 레이어를 통해 결과를 보정하는 경량이며 효율적인 희박에서 조밀로의 다중 시야 입체 영역 프레임워크를 제안한다. 이 방법은 DTU와 Tanks and Temples에서 최신 기술 수준의 정확도를 달성하면서도 Point-MVSNet과 R-MVSNet보다 각각 5배와 14배 빠르며, 메모리 효율적이고 종단 간 훈련이 가능한 설계 덕분이다.

ABSTRACT

Almost all previous deep learning-based multi-view stereo (MVS) approaches focus on improving reconstruction quality. Besides quality, efficiency is also a desirable feature for MVS in real scenarios. Towards this end, this paper presents a Fast-MVSNet, a novel sparse-to-dense coarse-to-fine framework, for fast and accurate depth estimation in MVS. Specifically, in our Fast-MVSNet, we first construct a sparse cost volume for learning a sparse and high-resolution depth map. Then we leverage a small-scale convolutional neural network to encode the depth dependencies for pixels within a local region to densify the sparse high-resolution depth map. At last, a simple but efficient Gauss-Newton layer is proposed to further optimize the depth map. On one hand, the high-resolution depth map, the data-adaptive propagation method and the Gauss-Newton layer jointly guarantee the effectiveness of our method. On the other hand, all modules in our Fast-MVSNet are lightweight and thus guarantee the efficiency of our approach. Besides, our approach is also memory-friendly because of the sparse depth representation. Extensive experimental results show that our method is 5$ imes$ and 14$ imes$ faster than Point-MVSNet and R-MVSNet, respectively, while achieving comparable or even better results on the challenging Tanks and Temples dataset as well as the DTU dataset. Code is available at https://github.com/svip-lab/FastMVSNet.

연구 동기 및 목표

  • 기존의 딥 러닝 기반 MVS 방법들이 큰 3D 비용 볼륨으로 인해 계산 비용이 많이 들고 메모리 소비가 크다는 문제를 해결하기 위해.
  • 희박에서 조밀로, 군집에서 세밀한 단계로의 프레임워크를 활용해 재구성 효율성을 높이되 정확도를 희생하지 않기 위해.
  • 경량이며 미분 가능한 모듈을 설계하여 종단 간 훈련이 가능하게 하면서도 고해상도 깊이 세부 정보를 유지하기 위해.
  • 로봇 공학 및 증강 현실과 같은 실용적 애플리케이션에서 고해상도 MVS에 실시간 성능을 달성하기 위해.

제안 방법

  • 다중 시야 영상의 2D 컨볼루션 특징에서 희박한 비용 볼륨을 구성하여 3D 컨볼루션 네트워크를 사용해 희박한 고해상도 깊이 맵을 예측한다.
  • 작은 규모의 컨볼루션 네트워크가 국소 영상 영역 내 깊이 의존성을 학습하여 희박한 깊이 값을 전파하고 깊이 맵을 조밀하게 만들며, 연관 양자화된 이중 필터링에 영감을 받는다.
  • 다중 시야 특징과 군집 깊이 예측을 사용해 조밀한 깊이 맵을 보정하기 위해 미분 가능한 가우시안-뉴턴 레이어를 도입한다.
  • 전파 모듈은 데이터에 적응적이며 국소 깊이 일관성을 모델링하여 깊이 조밀화 과정을 설명한다.
  • 모든 구성 요소는 경량이며 종단 간 훈련이 가능하며, 희박한 표현을 통해 효율적인 추론과 메모리 효율성을 달성한다.
  • 광학적 필터링, 기하학적 일관성 검사, 다중 시야 평균화를 통해 깊이 융합을 수행하여 최종 재구성 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1기존의 3D 컨볼루션 네트워크 기반 방법들과 비교해 유의미하게 추론 속도와 메모리 효율성을 향상시키면서도 높은 정확도를 달성할 수 있는 희박에서 조밀로, 군집에서 세밀한 단계로의 MVS 프레임워크는 가능한가?
  • RQ2큰 3D 컨볼루션에 의존하지 않고도 학습 가능한 국소 전파 네트워크가 희박한 고해상도 깊이 맵을 얼마나 효과적으로 조밀하게 만들 수 있는가?
  • RQ3경량이며 종단 간 훈련 가능한 MVS 파이프라인에서, 미분 가능한 가우시안-뉴턴 보정 레이어가 깊이 맵 정확도를 얼마나 향상시키는가?
  • RQ4기하학적 일관성 임계값과 가시 시야 수와 같은 하이퍼파라미터는 재구성의 정확도와 완전성 간의 트레이드오���에 어떤 영향을 미치는가?

주요 결과

  • Fast-MVSNet는 DTU 데이터셋에서 Point-MVSNet과 R-MVSNet보다 각각 5배와 14배 빠른 성능을 보이며, 비교적 동일하거나 더 높은 정확도를 유지한다.
  • 큰 3D 비용 볼륨을 피하고 희박한 표현을 사용함으로써 메모리 소비를 줄여 고해상도 시나리오에 적합하다.
  • 가우시안-뉴턴 보정 레이어는 기준선 대비 재구성 정확도를 10% 향상시키며, 한 번의 반복 이후에는 추가적인 성능 향상이 거의 없다.
  • 융합 하이퍼파라미터(η와 V)는 정확도와 완전성 간의 트레이드오���에 크게 영향을 미치며, η=0.12와 V=3일 때 가장 우수한 종합 성능을 보였다.
  • 제거 분석 결과, 가우시안-뉴턴 레이어가 매우 효과적이며, 한 번의 반복 후 성능이 안정화되어 단일 단계 보정에의 사용을 정당화한다.
  • DTU 데이터셋에서의 재구성 결과는 모든 시나리오에서 조밀하고 정확하며 노이즈에 강건한 3D 출력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.