Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Inverse Depth Regression for Multi-View Stereo with Correlation Cost Volume

Qingshan Xu, Wenbing Tao|arXiv (Cornell University)|2019. 12. 26.
Advanced Vision and Imaging참고 문헌 24인용 수 6
한 줄 요약

이 논문은 CIDER를 제안하며, 평균 그룹별 상관관계 기반의 경량화된 상관비용 볼륨을 사용하여 메모리와 계산량을 줄이고, 하위픽셀 정확도와 확장성을 확보하기 위해 깊이 추정을 역깊이 회귀로 재정의하는 새로운 다중시점 스테레오 방법을 제시한다. 이 방법은 DTU 및 Tanks and Temples 벤치마크에서 최신 기술 수준 성능을 달성하며, 대규모 환경과 모호한 영역에서 더 높은 강인성을 확보한다.

ABSTRACT

Deep learning has shown to be effective for depth inference in multi-view stereo (MVS). However, the scalability and accuracy still remain an open problem in this domain. This can be attributed to the memory-consuming cost volume representation and inappropriate depth inference. Inspired by the group-wise correlation in stereo matching, we propose an average group-wise correlation similarity measure to construct a lightweight cost volume. This can not only reduce the memory consumption but also reduce the computational burden in the cost volume filtering. Based on our effective cost volume representation, we propose a cascade 3D U-Net module to regularize the cost volume to further boost the performance. Unlike the previous methods that treat multi-view depth inference as a depth regression problem or an inverse depth classification problem, we recast multi-view depth inference as an inverse depth regression task. This allows our network to achieve sub-pixel estimation and be applicable to large-scale scenes. Through extensive experiments on DTU dataset and Tanks and Temples dataset, we show that our proposed network with Correlation cost volume and Inverse DEpth Regression (CIDER), achieves state-of-the-art results, demonstrating its superior performance on scalability and accuracy.

연구 동기 및 목표

  • 다중시점 스테레오(MVS)에서 전통적인 3D 비용 볼륨 표현 방식의 높은 메모리 및 계산 비용 문제를 해결하기 위해.
  • 텍스처가 없는 영역이나 반사 표면과 같은 어려운 영역에서의 깊이 추정 정확도를 향상시키기 위해.
  • 대규모 3D 재구성 시나리오에서 강인한 하위픽셀 깊이 추정을 가능하게 하기 위해.
  • 후처리 보정 기법(예: 변분 보정 또는 CRF)에 대한 의존도를 줄이기 위해 네트워크 내 깊이 회귀 전략을 개선하기 위해.
  • 임의의 수의 소스 이미지를 지원하는 확장 가능하고 경량화된 비용 볼륨을 개발하기 위해.

제안 방법

  • 기준 이미지와 소스 이미지 간의 압축된, 경량화된 비용 볼륨 특징을 계산하기 위해 평균 그룹별 상관관계 유사도 측정법을 제안한다.
  • 다양이 가능한 왜곡 모듈을 사용하여 시야 간 특징를 투영하고, 그룹화된 상관관계를 사용해 유사도 점수를 계산한다.
  • 모든 소스 이미지의 유사도 점수를 평균하여 통합된 비용 볼륨을 구성함으로써, 다중시점 컨텍스트의 효율적 통합을 가능하게 한다.
  • 비용 볼륨을 점진적으로 정규화하고 모호한 영역의 노이즈를 억제하기 위해 캐스케이드 3D U-Net 아키텍처를 도입한다.
  • 깊이 추론을 역깊이 회귀로 재정의한다: 깊이 가설은 역깊이 공간에서 균일하게 샘플링되고, 네트워크는 정밀한 깊이 예측을 위한 하위픽셀 순서값을 회귀한다.
  • 예측된 순서값을 다시 원래 깊이로 변환하여 하위픽셀 정확도를 확보하고, 대규모 환경에서 더 나은 일반화 성능을 확보한다.

실험 결과

연구 질문

  • RQ1그룹별 상관관계 기반의 경량 비용 볼륨이 MVS에서 정확도를 유지하면서도 메모리와 계산량을 줄일 수 있는가?
  • RQ2하위픽셀 정확도와 일반화 성능 측면에서, 균일 깊이 회귀나 역깊이 분류에 비해 역깊이 회귀가 더 우수한가?
  • RQ3캐스케이드 3D U-Net이 표준 3D U-Net이나 반복 정규화에 비해 모호한 영역과 에지 영역에서 깊이 추정 성능을 향상시킬 수 있는가?
  • RQ4높은 해상도 및 대규모 환경에서도 금전적인 메모리 사용 없이 이 방법이 어떻게 확장 가능한가?
  • RQ5변분 보정 또는 CRF와 같은 후처리 보정 기법에 대한 의존도가 어느 정도 감소하는가?

주요 결과

  • DTU 데이터셋에서 CIDER는 평균 완전성 점수 0.437과 총점수 0.427을 기록하여, 후처리 없이도 MVSNet과 R-MVSNet을 초월한다.
  • Tanks and Temples Intermediate 데이터셋에서 CIDER는 F1 점수 46.76%를 기록하여 MVSNet을 3.28% 초월하며, 대규모 환경에서도 뛰어난 성능을 보였다.
  • Tanks and Temples Advanced 데이터셋에서 CIDER는 F1 점수 23.12%를 기록하여, 후처리 없이도 R-MVSNet을 능가하여 어려운 대규모 환경에서도 강인함을 입증했다.
  • 캐스케이드 3D U-Net 필터링은 AGC-IDR에 비해 모호한 영역의 노이즈를 크게 감소시켜, 메모리 증가 없이도 재구성 품질을 향상시켰다.
  • 256개의 깊이 샘플을 사용할 경우, CIDER는 Tanks and Temples 트레이닝 세트에서 F1 점수를 48.66%에서 49.60%로 향상시키면서도 수용 가능한 메모리 사용량을 유지했다.
  • 제안된 상관비용 볼륨은 임의의 수의 소스 이미지로의 확장성을 가능하게 하였으며, 기존 3D 비용 볼륨 대비 메모리 소비를 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.