Skip to main content
QUICK REVIEW

[논문 리뷰] Towards 3D Scene Reconstruction from Locally Scale-Aligned Monocular Video Depth

Guangkai Xu, Wei Yin|arXiv (Cornell University)|2022. 02. 03.
Advanced Vision and Imaging인용 수 6
한 줄 요약

이 논문은 단일 영상에서 깊이 추정 시 스케일과 시프트를 복원하기 위해 局소 가중 선형 회귀 방법을 제안하며, 화면 간 스케일 일관성을 보장한다. 희박한 앵커 포인트를 활용하고 630만 장의 RGBD 이미지로 훈련함으로써, 제로샷 벤치마크에서 기존 최고 성능 모델보다 최대 50% 향상시키며, 프레임별 예측을 사용하여 정확한 3차원 환경 재구성 가능하다.

ABSTRACT

Existing monocular depth estimation methods have achieved excellent robustness in diverse scenes, but they can only retrieve affine-invariant depth, up to an unknown scale and shift. However, in some video-based scenarios such as video depth estimation and 3D scene reconstruction from a video, the unknown scale and shift residing in per-frame prediction may cause the depth inconsistency. To solve this problem, we propose a locally weighted linear regression method to recover the scale and shift with very sparse anchor points, which ensures the scale consistency along consecutive frames. Extensive experiments show that our method can boost the performance of existing state-of-the-art approaches by 50% at most over several zero-shot benchmarks. Besides, we merge over 6.3 million RGBD images to train strong and robust depth models. Our produced ResNet50-backbone model even outperforms the state-of-the-art DPT ViT-Large model. Combining with geometry-based reconstruction methods, we formulate a new dense 3D scene reconstruction pipeline, which benefits from both the scale consistency of sparse points and the robustness of monocular methods. By performing the simple per-frame prediction over a video, the accurate 3D scene shape can be recovered.

연구 동기 및 목표

  • 영상 프레임 간 단일 영상 깊이 추정에서 발생하는 스케일 및 시프트의 일관성 없는 문제를 해결하기 위해.
  • 단일 영상에서의 3차원 환경 재구성의 견고성과 정확도를 향상시키기 위해.
  • 스케일 일관성 있는 희박한 점들을 단일 영상 깊이 모델과 결합한 확장 가능한 파이프라인 개발을 위해.
  • 일반화 성능 향상을 위해 630만 장의 RGBD 이미지로 강력한 깊이 모델을 훈련시키기 위해.

제안 방법

  • 연속된 영상 프레임 간 매우 희박한 앵커 포인트에서 스케일과 시프트를 추정하기 위해 局소 가중 선형 회귀 기법을 사용한다.
  • 이러한 희박한 앵커 포인트를 이용해 깊이 예측을 프레임 간 정렬함으로써 스케일 일관성을 강제한다.
  • ResNet50 백본을 사용하여 630만 장이 넘는 RGBD 이미지로 구성된 대규모 데이터셋을 구축하여 견고한 깊이 모델을 사전 훈련한다.
  • 훈련된 깊이 모델을 기하 기반 재구성 방법과 결합하여 밀도 높은 3차원 환경를 생성한다.
  • 프레임별 단일 영상 깊이 예측을 입력으로 사용하며, 제안된 회귀 기법을 통해 스케일 보정을 적용한다.
  • 최종 파이프라인은 명시적 다중 시야 기하학 또는 명시적 깊이 감독 없이도 정확한 3차원 재구성 가능하다.

실험 결과

연구 질문

  • RQ1연속된 영상 프레임 간 단일 영상 영상 깊이 추정에서 발생하는 스케일 및 시프트의 일관성 없는 문제를 효과적으로 수정할 수 있는 방법은 무엇인가?
  • RQ2스케일 일관성이 단일 영상에서의 3차원 환경 재구성 정확도에 얼마나 기여하는가?
  • RQ3대규모 RGBD 데이터셋이 단일 영상 깊이 모델의 견고성에 상당한 영향을 미칠 수 있는가?
  • RQ4제안된 방법이 피팅 튜닝 없이 제로샷 벤치마크에서 최고 성능 모델을 초월할 수 있는가?
  • RQ5간단한 프레임별 예측 파이프라인에 스케일 보정을 결합하면 고해상도의 3차원 재구성 가능할 수 있는가?

주요 결과

  • 제안된 방법은 제로샷 벤치마크에서 기존 최고 성능 깊이 추정 모델의 성능을 최대 50% 향상시킨다.
  • 630만 장의 RGBD 이미지로 훈련된 ResNet50 백본 모델이 최고 성능의 DPT ViT-Large 모델을 능가한다.
  • 희박한 앵커 포인트를 통한 스케일 일관성이 3차원 환경 재구성 품질을 크게 향상시킨다.
  • 이 방법은 프레임별 단일 영상 깊이 예측만으로도 정확한 밀도 높은 3차원 재구성 가능하다.
  • 다양한 환경에서 견고성을 유지하면서도 높은 기하학적 정밀도를 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.