Skip to main content
QUICK REVIEW

[논문 리뷰] Attention Aware Cost Volume Pyramid Based Multi-view Stereo Network for 3D Reconstruction

Anzhu Yu, Wenyue Guo|arXiv (Cornell University)|2020. 11. 25.
Advanced Vision and Imaging참고 문헌 54인용 수 4
한 줄 요약

이 논문은 다중 시야 입체 영역에서 깊이 추정 성능을 향상시키기 위해 자기주의 모듈을 사용한 특징 추출과 유사도 기반의 비용 볼륨 구축을 통한 군집-세분화 다중 시야 입체 네트워크인 AACVP-MVSNet을 제안한다. 다양한 해상도에서 반복적으로 깊이 맵을 개선하면서도 검색 범위를 줄임으로써, DTU 및 BlendedMVS 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 최적 설정에서 DTU에서의 평균 정확도는 0.326mm를 기록하였다.

ABSTRACT

We present an efficient multi-view stereo (MVS) network for 3D reconstruction from multiview images. While previous learning based reconstruction approaches performed quite well, most of them estimate depth maps at a fixed resolution using plane sweep volumes with a fixed depth hypothesis at each plane, which requires densely sampled planes for desired accuracy and therefore is difficult to achieve high resolution depth maps. In this paper we introduce a coarseto-fine depth inference strategy to achieve high resolution depth. This strategy estimates the depth map at coarsest level, while the depth maps at finer levels are considered as the upsampled depth map from previous level with pixel-wise depth residual. Thus, we narrow the depth searching range with priori information from previous level and construct new cost volumes from the pixel-wise depth residual to perform depth map refinement. Then the final depth map could be achieved iteratively since all the parameters are shared between different levels. At each level, the self-attention layer is introduced to the feature extraction block for capturing the long range dependencies for depth inference task, and the cost volume is generated using similarity measurement instead of the variance based methods used in previous work. Experiments were conducted on both the DTU benchmark dataset and recently released BlendedMVS dataset. The results demonstrated that our model could outperform most state-of-the-arts (SOTA) methods. The codebase of this project is at https://github.com/ArthasMil/AACVP-MVSNet.

연구 동기 및 목표

  • 기존의 학습 기반 MVS 방법에서 고정 해상도 깊이 추정의 한계를 해결하기 위해, 높은 메모리 사용량과 해상도 제한 문제를 개선한다.
  • 이전 깊이 추정 결과를 활용해 검색 범위를 좁힘으로써 깊이 맵의 정확도와 해상도를 향상시키기 위해 군집-세분화 추론 전략을 도입한다.
  • 특징 추출 블록에 자기주의 모듈을 통합하여 깊이 추론을 위한 특징 표현을 향상시킨다.
  • 분산 기반 비용 볼륨 계산을 유사도 측정 방법으로 대체하여 더 견고한 비용 볼륨 구축을 실현한다.
  • 효율성과 일관성을 확보하기 위해 다중 해상도에서 종단 간(end-to-end), 매개변수 공유의 깊이 개선을 달성한다.

제안 방법

  • 각 더 세밀한 수준이 이전 수준의 업샘플링 결과를 기반으로 하되, 픽셀 단위의 깊이 잔차 보정을 적용하는 군집-세분화 깊이 추론 전략을 사용한다.
  • 다중 시야 이미지 간 장거리 상관관계를 포착하기 위해 특징 추출 블록에 자기주의 레이어를 통합한다.
  • 분산 기반 방법 대신 유사도 기반 비용 볼륨을 구축함으로써, 무문자나 반사성 영역에 대한 견고성을 향상시킨다.
  • 이전 수준의 깊이 잔차를 사용해 각 수준에서 비용 볼륨을 재계산함으로써 깊이 검색 공간을 축소하고 개선 정확도를 향상시킨다.
  • 모든 네트워크 매개변수를 수준 간에 공유함으로써, 재학습 없이도 효율적이고 반복적인 깊이 맵 개선을 가능하게 한다.
  • DTU 및 BlendedMVS 데이터셋에서 진짜 깊이 맵을 사용한 지도 학습을 통해 종단 간(end-to-end)으로 네트워크를 훈련시킨다.

실험 결과

연구 질문

  • RQ1깊이 잔차 보정을 포함한 군집-세분화 전략이 다중 시야 입체 영역에서 고해상도 깊이 맵 추정을 향상시킬 수 있는가?
  • RQ2특징 추출에 자기주의를 통합하면, 특히 낮은 무늬 영역에서 깊이 추론 성능이 향상되는가?
  • RQ3유사도 기반 비용 볼륨 구축 방식이 기존의 분산 기반 방법보다 정확도와 견고성 측면에서 뛰어나게 되는가?
  • RQ4학습 기반 MVS 프레임워크에서 입력 시야 수가 최종 재구성 품질에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 DTU 및 BlendedMVS와 같은 표준 MVS 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?

주요 결과

  • 제안된 AACVP-MVSNet은 DTU 벤치마크에서 평균 정확도 0.326mm를 기록하여, 이 데이터셋에 대해 지금까지 보고된 바 중 최고 성능이다.
  • DTU 및 BlendedMVS 데이터셋 양쪽에서 대부분의 최신 기술 수준(SOTA) 방법보다 뛰어난 성능을 보이며, 더 높은 재구성 정확도와 완전성(Completeness)을 입증하였다.
  • 7개의 훈련 시야와 5개의 평가 시야를 사용할 경우 전체 성능이 최고로 나타났으며, 완전성 점수는 0.299mm, 평균 정확도는 0.326mm를 기록하였다.
  • 다양한 훈련 설정에서 40번째 에포크까지 안정적으로 수렴함으로써, 신뢰할 수 있고 일관된 훈련 행동을 보였다.
  • 제거 실험(ablation study) 결과, 자기주의와 유사도 기반 비용 볼륨이 기준 설정 대비 성능 향상에 크게 기여하는 것으로 확인되었다.
  • 군집-세분화 전략은 더 세밀한 수준에서 깊이 검색 공간을 효과적으로 줄여, 과도한 메모리 소비 없이 고해상도 깊이 추정을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.