Skip to main content
QUICK REVIEW

[논문 리뷰] Total3DUnderstanding: Joint Layout, Object Pose and Mesh Reconstruction for Indoor Scenes from a Single Image

Yinyu Nie, Xiaoguang Han|arXiv (Cornell University)|2020. 02. 27.
3D Surveying and Cultural Heritage참고 문헌 49인용 수 8
한 줄 요약

이 논문은 단일 이미지에서 종합적인 3D 시나리오 재구성을 위한 엔드 투 엔드 방법인 Total3DUnderstanding을 제안한다. 이 방법은 동시에 실내 레이아웃, 카메라 자세, 3D 객체 경계 상자, 그리고 세밀한 객체 메시를 예측한다. 군집화된 계층 구조와 협력적이고 전역적인 손실을 통한 공동 학습을 통해 SUN RGB-D 및 Pix3D 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 레이아웃 추정, 3D 검출, 메시 재구성에서 이전 방법들을 능가한다.

ABSTRACT

Semantic reconstruction of indoor scenes refers to both scene understanding and object reconstruction. Existing works either address one part of this problem or focus on independent objects. In this paper, we bridge the gap between understanding and reconstruction, and propose an end-to-end solution to jointly reconstruct room layout, object bounding boxes and meshes from a single image. Instead of separately resolving scene understanding and object reconstruction, our method builds upon a holistic scene context and proposes a coarse-to-fine hierarchy with three components: 1. room layout with camera pose; 2. 3D object bounding boxes; 3. object meshes. We argue that understanding the context of each component can assist the task of parsing the others, which enables joint understanding and reconstruction. The experiments on the SUN RGB-D and Pix3D datasets demonstrate that our method consistently outperforms existing methods in indoor layout estimation, 3D object detection and mesh reconstruction.

연구 동기 및 목표

  • 단일 이미지에서 레이아웃, 객체 자세, 세밀한 메시를 공동으로 학습하여 시나리오 이해와 3D 객체 재구성 간 격차를 해소한다.
  • 이전 방법들이 시나리오 이해와 메시 재구성을 별개 또는 고립된 작업으로 간주하는 한계를 해결한다.
  • 객체 간 다방향 관계를 모델링하고 시나리오 컨텍스트를 활용하여 3D 재구성의 정확도와 강건성을 향상시킨다.
  • 차별 가능한 메시 기반 재구성 파이프라인을 개발하여 시나리오 수준의 감독을 통해 공동 최적화를 가능하게 한다.
  • 밀도 기반 토폴로지 수정기를 통해 아티팩트를 줄이고 메시 생성의 토폴로지 품질을 향상시킨다.

제안 방법

  • 방법은 세 가지 구성 요소로 이루어진 군집화 계층 구조 프레임워크를 사용한다: 카메라 자세 포함 실내 레이아웃, 3D 객체 경계 상자, 객체 메시 재구성.
  • 지역적 정점 밀도 기반으로 메시 엣지를 제거하여 형태 근사화를 향상시키고 고정된 거리 임계값에 의존하지 않는 새로운 밀도 기반 토폴로지 수정기를 도입한다.
  • 예측된 객체 위치와 진짜 값 간의 일致성을 강제하기 위해 객체 검출과 메시 재구성 간의 일致성을 확보하는 협력적 손실($\mathcal{L}_{co}$)을 설계한다.
  • 재구성된 메시와 진짜 시나리오 포인트 클라우드 간 평균 점-메시 거리를 최소화하기 위해 전역 메시 손실($\mathcal{L}_{g}$)을 사용한다.
  • 객체 제안에서 유도된 관계 특징을 추출하여 객체 간 다방향 의존성을 모델링함으로써 검출 및 재구성 정확도를 향상시킨다.
  • 전체 파이프라인은 레이아웃, 검출, 메시 생성 모듈 간 공유 특징을 활용하여 다중 작업 감독 하에 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1독립적 또는 순차적 접근 방식에 비해 종합적인 레이아웃, 객체 자세, 3D 메시 재구성 학습이 모든 하위 작업의 성능 향상에 기여하는가?
  • RQ2복잡한 실내 환경에서 객체 간 다방향 관계를 모델링하면 3D 검출 및 메시 재구성에 어떤 영향을 미치는가?
  • RQ3밀도 기반 토폴로지 수정기는 임계값 기반 면 제거 방식에 비해 메시 품질과 강건성 향상에 얼마나 기여하는가?
  • RQ4시나리오 수준 감독(\mathcal{L}_{g}를 통해) 및 협력적 제약($\mathcal{L}_{co}$)을 통한 공동 최적화가 더 나은 정렬 및 재구성 정확도를 이끌어내는가?
  • RQ5시나리오 컨텍스트(레이아웃 및 카메라 자세) 통합이 인스턴스 수준의 메시 재구성 품질 향상에 기여하는가?

주요 결과

  • 제안된 방법은 SUN RGB-D 데이터셋에서 레이아웃 추정에 대해 3D IoU 59.25%를 달성하여 베이스라인 대비 1.62%p 향상되었으며, 새로운 최신 기술 수준을 설정했다.
  • 3D 객체 검출에서 평균 정밀도(mAP)는 26.38%를 기록하여 베이스라인 대비 6.19%p 향상되었으며, 공동 학습의 유의미한 성과를 보여주었다.
  • 시나리오 메시 재구성 손실($\mathcal{L}_{g}$)은 1.43×10⁻²로 감소하여 베이스라인 대비 32% 향상되어 더 나은 정렬 및 형태 정확도를 나타낸다.
  • 절단 실험 결과, $\mathcal{L}_{co}$와 $\mathcal{L}_{g}$를 모두 사용한 공동 훈련이 가장 높은 성능을 내며, 특히 $\mathcal{L}_{g}$가 검출 및 메시 품질에 가장 큰 영향을 미친다.
  • 관계 특징의 통합으로 인해 3D 검출 mAP가 베이스라인 대비 3.13p 향상되었으며, 객체 상호작용을 모델링하는 데서의 가치를 입증한다.
  • 밀도 기반 토폴로지 수정기는 다양한 실내 객체 형태와 복잡한 배경 환경에 대해 강건하여, 임계값 기반 면 제거 방식에 비해 우수한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.