Skip to main content
QUICK REVIEW

[논문 리뷰] Im2Struct: Recovering 3D Shape Structure from a Single RGB Image

Chengjie Niu, Jun Li|arXiv (Cornell University)|2018. 04. 16.
Advanced Vision and Imaging참고 문헌 22인용 수 11
한 줄 요약

이 논문은 단일 RGB 이미지에서 부분 연결성과 대칭성을 포함한 세부적인 3D 큐브이드 기반 형상 구조를 복원하는 딥러닝 프레임워크인 Im2Struct를 제안한다. 이는 다중 척도 컨볼루션 구조 마스킹 네트워크를 통해 객체 구조를 강조하고, 그 다음에 이미지 특징을 융합하여 가능성이 높은 3D 큐브이드 계층을 재구성하는 순환 신경망 디코더를 사용하는 이단계 네트워크를 활용한다. 이로 인해 3D 부분 구조 복원에서 최신 기술 수준의 정확성과 구조적 타당성을 달성한다.

ABSTRACT

We propose to recover 3D shape structures from single RGB images, where structure refers to shape parts represented by cuboids and part relations encompassing connectivity and symmetry. Given a single 2D image with an object depicted, our goal is automatically recover a cuboid structure of the object parts as well as their mutual relations. We develop a convolutional-recursive auto-encoder comprised of structure parsing of a 2D image followed by structure recovering of a cuboid hierarchy. The encoder is achieved by a multi-scale convolutional network trained with the task of shape contour estimation, thereby learning to discern object structures in various forms and scales. The decoder fuses the features of the structure parsing network and the original image, and recursively decodes a hierarchy of cuboids. Since the decoder network is learned to recover part relations including connectivity and symmetry explicitly, the plausibility and generality of part structure recovery can be ensured. The two networks are jointly trained using the training data of contour-mask and cuboid structure pairs. Such pairs are generated by rendering stock 3D CAD models coming with part segmentation. Our method achieves unprecedentedly faithful and detailed recovery of diverse 3D part structures from single-view 2D images. We demonstrate two applications of our method including structure-guided completion of 3D volumes reconstructed from single-view images and structure-aware interactive editing of 2D images.

연구 동기 및 목표

  • 단일 시점 3D 복원에서 3D 형상 구조 복원의 부족함, 특히 체적 출력에서 위상적 및 구성적 정보의 손실 문제를 해결하기 위해.
  • 단일 2D 이미지에서 큐브이드와 그 관계(연결성, 대칭성)로 구성된 3D 부분 구조를 직접 추론할 수 있도록 하기 위해.
  • 딥러닝 기반 2D에서 3D로의 매핑에 구조적 추론을 통합하여 3D 형상 복원의 정확성과 타당성을 향상시키기 위해.
  • 명시적인 3D 구조적 사전 지식을 제공하여 후속 응용 분야인 구조 인식 3D 볼륨 정밀화 및 상호작용 가능한 2D 이미지 편집을 지원하기 위해.

제안 방법

  • 스킵 연결을 갖춘 다중 척도 컨볼루션 신경망(CNN)을 구조 마스킹 네트워크로 사용하여 배경과 텍스처를 억제하면서 객체 구조를 강조하는 윤곽 마스크를 생성한다.
  • 구조 복원 네트워크는 입력 이미지와 구조 마스크의 특징을 융합한 후, 순환 신경망(RvNN)을 사용하여 계층적 큐브이드 구조로 재구성한다.
  • RvNN 디코더는 부분 관계, 특히 연결성과 반사 대칭성을 명시적으로 모델링하도록 훈련되어 기하학적으로 타당한 3D 구조를 보장한다.
  • 두 네트워크는 짝지어진 훈련 데이터를 사용하여 공동으로 훈련되며, 렌더링된 CAD 모델에서 유도된 진짜 윤곽 마스크와 해당 3D 큐브이드 구조 애너테이션을 제공한다.
  • 훈련 데이터는 주어진 3D CAD 모델을 렌더링하여 생성되며, 감독을 위해 이미지의 윤곽 마스크와 3D 큐브이드 구조의 쌍을 생성한다.
  • 후처리 단계로 카메라 시점 추정과 3D 큐브이드를 2D 공간으로 투영하여 입력 이미지와 정렬함으로써 구조 인식 기반 편집을 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델은 단일 2D RGB 이미지에서 대칭성 및 연결성과 같은 부분 관계를 포함한 세부적인 3D 형상 구조를 복원할 수 있는가?
  • RQ2구조적 추론(예: 대칭성 및 연결성)을 신경망 내에서 명시적으로 모델링하는 방법은 3D 부분 구조 복원의 타당성을 향상시키는 데 어떻게 기여하는가?
  • RQ3구조 인식 3D 복원은 단일 시점 이미지에서의 체적 3D 복원 품질을 어느 정도 향상시킬 수 있는가?
  • RQ4회복된 3D 구조는 기존 방법에 비해 더 직관적이고 의미적으로 일관된 2D 이미지 편집을 가능하게 하는가?

주요 결과

  • 이 방법은 단일 시점 2D 이미지에서 3D 부분 구조를 이전 접근 방식에 비해 뛰어난 정확성과 타당성으로 복원함으로써 새로운 기준을 설정한다.
  • VGG-19 백본을 사용할 경우, 구조 마스킹 네트워크는 윤곽 마스크 오차 0.0846을 기록하고 δ < 0.1일 때 78.5%의 정확도를 달성하여 구조 정위치 추정에서 뛰어난 성능을 보였다.
  • 구조 복원 네트워크는 연결성과 반사 대칭성을 성공적으로 추론하였으며, 의자 구조 예시에서 빨간 화살표로 표시된 대칭 다리 쌍의 회복을 통해 이를 입증하였다.
  • 볼륨 정밀화 과정에서, 복원된 대칭 관계는 3D-GAN 출력에서 누락된 볼륨을 보완하여 구조적 대칭성을 복원하고 복원 품질을 향상시켰다.
  • 이 방법은 자동으로 3D 큐브이드 프록시를 생성함으로써 구조 인식 기반 2D 이미지 편집을 가능하게 하여, 구조적 일관성을 유지하면서 타당한 형태 변형을 유도한다.
  • 이 프레임워크는 단일 RGB 이미지에서 3D 형상 구조와 부분 관계를 동시에 복원하는 최초의 시스템으로, 구조 인식 3D 복원 분야의 새로운 기준을 설정하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.