Skip to main content
QUICK REVIEW

[논문 리뷰] Neural 3D Scene Reconstruction with the Manhattan-world Assumption

Haoyu Guo, Sida Peng|arXiv (Cornell University)|2022. 05. 05.
Advanced Vision and Imaging인용 수 4
한 줄 요약

이 논문은 음의 거리 함수와 의미적 레이블을 3차원 공간에서 함께 최적화하는 새로운 손실를 통해 음영이 진 실내 환경에서의 기하 구조 재구성 품질을 향상시키기 위해 맨하탄 월드 가정을 암묵적 신경 표현에 통합하는 새로운 신경 3차원 환경 재구성 방법을 제안한다. 이 방법은 특히 평면 영역에서 상태최강 기법들보다 뛰어난 재구성 품질과 의미 일관성을 달성한다. 이는 ScanNet과 7-Scenes에서 검증되었다.

ABSTRACT

This paper addresses the challenge of reconstructing 3D indoor scenes from multi-view images. Many previous works have shown impressive reconstruction results on textured objects, but they still have difficulty in handling low-textured planar regions, which are common in indoor scenes. An approach to solving this issue is to incorporate planer constraints into the depth map estimation in multi-view stereo-based methods, but the per-view plane estimation and depth optimization lack both efficiency and multi-view consistency. In this work, we show that the planar constraints can be conveniently integrated into the recent implicit neural representation-based reconstruction methods. Specifically, we use an MLP network to represent the signed distance function as the scene geometry. Based on the Manhattan-world assumption, planar constraints are employed to regularize the geometry in floor and wall regions predicted by a 2D semantic segmentation network. To resolve the inaccurate segmentation, we encode the semantics of 3D points with another MLP and design a novel loss that jointly optimizes the scene geometry and semantics in 3D space. Experiments on ScanNet and 7-Scenes datasets show that the proposed method outperforms previous methods by a large margin on 3D reconstruction quality. The code is available at https://zju3dv.github.io/manhattan_sdf.

연구 동기 및 목표

  • 실내 환경에서 흔히 발생하는 낮은 무늬의 평면 영역(예: 바닥과 벽)에서의 열악한 3차원 재구성 문제를 해결한다.
  • 각 시점별 깊이 맵을 최적화하는 다중시점 스테레오(MVS) 방법의 한계를 극복하여 깊이 및 평면 추정의 일관성 없음을 해결한다.
  • 암묵적 신경 표현 학습 중 평면 영역의 기하 일관성을 강제하기 위해 맨하탄 월드 가정을 활용한다.
  • 기하 구조와 함께 3차원 의미를 함께 최적화하여 의미 분할 정확도를 향상시키고, 다양한 시점 간의 노이즈와 일관성 없는 결과를 줄인다.
  • 다중 시점 영상에서 통합된 암묵적 표현 프레임워크를 통해 전역적으로 일관된 3차원 재구성과 분할을 달성한다.

제안 방법

  • 임의의 3차원 점에 대해 부호 거리 함수(SDF), 색상, 의미 로짓을 예측하는 다층 퍼셉트론(MLP)을 사용해 3차원 환경를 표현한다.
  • 입력 영상에 대해 2차원 의미 분할 네트워크(예: DeepLabV3+)를 적용하여 의미 로짓을 초기화한다.
  • 바닥 및 벽 영역의 표면 법선이 세 개의 주요 수직 방향에 정렬하도록 정규화하여 맨하탄 월드 가정을 강제한다.
  • 2차원 분할의 정확도를 보정하기 위해 3차원 공간에서 SDF 기하 구조와 의미 로짓을 동시에 최적화하는 새로운 공동 최적화 손실를 도입한다.
  • 광학 일관성을 기반으로 엔드 투 엔드 학습이 가능한 가시화 가능 볼륨 렌더링을 사용하여 렌더링된 영상과 입력 영상 간의 비교를 수행한다.
  • 모든 입력 시점에서 기하 구조와 의미를 함께 최적화함으로써 학습 중 다중 시점 일관성을 적용한다.

실험 결과

연구 질문

  • RQ1암묵적 신경 표현 기반 3차원 재구성에 맨하탄 월드 가정을 효과적으로 통합할 수 있는가? 특히 평면 영역 재구성 향상에 기여하는가?
  • RQ2기하 구조와 의미를 함께 최적화하는 것이 별도 최적화와 비교해 재구성 품질과 분할 정확도를 어떻게 향상시키는가?
  • RQ3제안된 방법이 다중 시점 간 의미 분할의 노이즈와 일관성 없는 결과를 어느 정도 감소시키는가?
  • RQ4기하 구조와 의미의 공동 최적화가 낮은 무늬의 평면 영역의 더 정확하고 완전한 재구성으로 이어지는가?
  • RQ5재구성 정밀도, 재현율 및 새로운 시점 합성 품질 측면에서 상태최강의 MVS 및 신경 렌더링 기법들과 비교해 어떻게 성능을 냅니다?

주요 결과

  • 제안된 방법은 ScanNet과 7-Scenes 데이터셋에서 최신 기술 수준의 3차원 재구성 품질을 달성하였으며, 특히 평면 영역에서 정밀도와 재현율 모두 뚜렷한 향상을 보였다.
  • ScanNet에서, 이 방법은 COLMAP, NeRF, UNISURF, NeuS, VolSDF보다 재구성 정확도와 완전성 측면에서 뛰어나며, 특히 무늬가 없는 영역에서 두각을 나타냈다.
  • 바닥 영역의 의미 분할 IoU는 DeepLabV3+의 0.532에서 0.624로 향상되었고, 벽 영역은 0.475에서 0.518로 상승하여 분할의 일관성과 정확도 향상이 뚜렷했다.
  • 의미와 기하 구조의 공동 최적화로 인해, 특히 물체 경계 근처에서 다양한 시점 간의 노이즈와 일관성 없는 분할 레이블이 감소했다.
  • 새로운 시점 합성 결과에서, 더 높은 기하 정확도 덕분에 NeRF와 VolSDF보다 훨씬 뛰어난 품질의 영상을 생성했으며, 학습된 시점에서 멀리 떨어진 시점에서도 유사하게 우수한 성능을 보였다.
  • 비평면 영역에서는 고해상도 세부 사항을 유지하면서도 평면 구조 재구성 품질을 크게 향상시켜 강건성과 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.