Skip to main content
QUICK REVIEW

[논문 리뷰] Cost Volume Pyramid Based Depth Inference for Multi-View Stereo

Jiayu Yang, Wei Mao|arXiv (Cornell University)|2019. 12. 18.
Advanced Vision and Imaging참고 문헌 43인용 수 19
한 줄 요약

이 논문은 다중 시야 입체 깊이 추론을 위한 cost volume pyramid 기반 신경망인 CVP-MVSNet을 제안한다. 이는 반복적인 잔차 깊이 보정을 통해 비용 체적을 굵기에서 세밀함으로 구축함으로써, 각 피라미드 수준에서 해상도에 맞춘 컴act한 비용 체적을 구성한다. 이로 인해 Point-MVSNet과 같은 최신 기술 모델보다 6배 빠른 추론 속도를 달성하면서도 기준 데이터셋에서 정확도를 유지하거나 향상시킨다.

ABSTRACT

We propose a cost volume-based neural network for depth inference from multi-view images. We demonstrate that building a cost volume pyramid in a coarse-to-fine manner instead of constructing a cost volume at a fixed resolution leads to a compact, lightweight network and allows us inferring high resolution depth maps to achieve better reconstruction results. To this end, we first build a cost volume based on uniform sampling of fronto-parallel planes across the entire depth range at the coarsest resolution of an image. Then, given current depth estimate, we construct new cost volumes iteratively on the pixelwise depth residual to perform depth map refinement. While sharing similar insight with Point-MVSNet as predicting and refining depth iteratively, we show that working on cost volume pyramid can lead to a more compact, yet efficient network structure compared with the Point-MVSNet on 3D points. We further provide detailed analyses of the relation between (residual) depth sampling and image resolution, which serves as a principle for building compact cost volume pyramid. Experimental results on benchmark datasets show that our model can perform 6x faster and has similar performance as state-of-the-art methods. Code is available at https://github.com/JiayuYANG/CVP-MVSNet

연구 동기 및 목표

  • 고정 해상도 비용 체적을 사용하는 기존 다중 시야 입체 네트워크의 높은 메모리 및 계산 비용 문제를 해결하기 위해.
  • 粗糙에서 세밀한 방식으로 반복적인 비용 체적 피라미드를 통해 깊이 추정치를 보정하여 깊이 맵 정확도와 효율성을 향상시키기 위해.
  • 이미지 해상도에 기반한 깊이 샘플링 해상도 선택을 체계적으로 설정하여 컴팩트함과 효율성을 보장하기 위해.
  • 낮은 GPU 메모리 사용량과 더 빠른 추론 시간을 통해 고해상도 깊이 맵 추론을 가능하게 하기 위해.
  • Point-MVSNet과 같은 점 기반 MVS 네트워크에 대한 경량이고 효율적인 대안을 제공하면서도, 뛰어난 또는 동등한 성능을 달성하기 위해.

제안 방법

  • 입력 시야에서 이미지 피라미드를 구성하고, 가장 굵은 해상도에서 전체 깊이 범위에 걸쳐 균일한 샘플링을 사용해 전체 비용 체적을 구축한다.
  • 각 후속 피라미드 수준에서 현재 깊이 추정치 주변의 부분 비용 체적을 깊이 잔차를 사용해 구축함으로써 국소적이고 반복적인 정밀 조정을 가능하게 한다.
  • 깊이 잔차 탐색 범위는 원본 시야에서의 픽셀 간격에 의해 결정되며, 이는 깊이 샘플링 해상도와 이미지 해상도 간의 이론적 분석에 기반한다.
  • 정규화된 비용 체적에 다중 척도 3D CNN을 적용하여 국소적 스무딩을 강화하고 넓은 수용각을 포착한다.
  • 피라미드 수준 간에 특징을 공유하고, 재투영 및 특징 확보를 통해 원본 시야의 특징을 기준 시야에 정렬한다.
  • 최종 깊이 맵은 가장 굵은 해상도에서 시작하여 더 세밀한 세부 사항으로 진행되는 피라미드 수준 간의 반복적 보정을 통해 확보된다.

실험 결과

연구 질문

  • RQ1다중 시야 입체에서 고해상도 깊이 정확도를 유지하면서도 비용 체적 구성의 효율성과 컴팩트성을 어떻게 향상시킬 수 있는가?
  • RQ2계산 비용을 최소화하면서 정확도를 훼손하지 않기 위해 깊이 샘플링 해상도와 이미지 해상도 사이의 최적 관계는 무엇인가?
  • RQ3비용 체적 피라미드에서 반복적인 잔차 보정이 점 기반 또는 고정 해상도 비용 체적 방법보다 속도와 정확도 측면에서 뛰어나게 할 수 있는가?
  • RQ4깊이 잔차 탐색의 픽셀 간격 선택이 복원 품질과 계산 효율성에 어떤 영향을 미치는가?
  • RQ5비용 체적 피라미드 프레임워크는 최신 기술 대비 상당히 감소된 메모리 사용량과 더 빠른 추론 시간을 통해 고해상도 이미지를 처리할 수 있는가?

주요 결과

  • CVP-MVSNet은 현재 최신 기술인 Point-MVSNet보다 6배 빠른 속도를 기록하면서도 기준 데이터셋에서 경쟁 가능한 성능을 유지한다.
  • DTU 데이터셋에서 이 방법은 평균 f-스코어 측면에서 Point-MVSNet을 능가하며, 특히 에지 영역에서 더 부드럽고 세밀한 복원을 제공한다.
  • 2단계 피라미드 구성에서 최고의 정확도를 기록하였으며, 더 깊은 피라미드에서는 초깃값 깊이 맵의 해상도가 낮아져 성능이 떨어진다.
  • 깊이 보정에 최적의 픽셀 간격은 0.5에서 1.0 사이로 확인되었으며, 간격이 너무 작거나 (0.25) 너무 크면 (2.0) 성능이 저하된다.
  • Tanks and Temples 데이터셋에서 CVP-MVSNet은 Point-MVSNet보다 평균 f-스코어가 5% 높으며, 더 단순한 융합 파이프라인을 사용했음에도 불구하고 P-MVSNet보다 단지 1% 낮게 기록한다.
  • 정성적 결과에서는 CVP-MVSNet이 Point-MVSNet과 R-MVSNet에 비해 복잡한 구조(예: 屋根 가장자리)에서 더 많은 고주파 수치 세부 정보를 포착하는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.