Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Reconstruction of Simple Objects from A Single View Silhouette Image

Xinhan Di, P. L. Yu|arXiv (Cornell University)|2017. 01. 17.
Advanced Vision and Imaging참고 문헌 26인용 수 8
한 줄 요약

이 논문은 단일 뷰 실루엣 이미지에서 RGB 텍스처나 추가 감독 없이도 카테고리별 3D 재구성 가능하도록 스택드 계층적 딥 러닝 프레임워크를 제안한다. 종단 간 학습 전략과 거친 3D 볼륨 분할을 위한 복제 레이어를 활용함으로써, 3D-R2N2보다 최대 0.1 높은 IoU를 달성하고 구면 상에서 넓고 무작위로 분포된 뷰에서도 뛰어난 성능을 보이며, 기존 방법들보다 도전적인 단일 뷰 실루엣 재구성에서 슈퍼리어한 성능을 보인다.

ABSTRACT

While recent deep neural networks have achieved promising results for 3D reconstruction from a single-view image, these rely on the availability of RGB textures in images and extra information as supervision. In this work, we propose novel stacked hierarchical networks and an end to end training strategy to tackle a more challenging task for the first time, 3D reconstruction from a single-view 2D silhouette image. We demonstrate that our model is able to conduct 3D reconstruction from a single-view silhouette image both qualitatively and quantitatively. Evaluation is performed using Shapenet for the single-view reconstruction and results are presented in comparison with a single network, to highlight the improvements obtained with the proposed stacked networks and the end to end training strategy. Furthermore, 3D re- construction in forms of IoU is compared with the state of art 3D reconstruction from a single-view RGB image, and the proposed model achieves higher IoU than the state of art of reconstruction from a single view RGB image.

연구 동기 및 목표

  • RGB 텍스처가 없고 높은 모호성이 존재하는 단일 뷰 실루엣 이미지에서의 3D 재구성 문제를 해결하기 위해.
  • 실루엣 전용 입력에 대해 딥 러닝 사전 지식을 활용해 RGB 텍스처나 추가 감독에 대한 의존도를 줄이기 위해.
  • 제한된 원형 뷰 구성이 아닌, 전체 구면 상에 넓게 무작위로 분포된 단일 뷰 실루엣에서도 강인한 3D 재구성을 가능하게 하기 위해.
  • 향상된 성능을 위해 종단 간 학습 전략을 적용한 새로운 스택드 계층적 네트워크 아키텍처를 개발하기 위해.
  • RGB 이미지로 훈련된 방법들보다도 뛰어난 IoU 성능을 보이며, 실루엣에서의 카테고리별 3D 재구성에서 최신 기술 수준을 확립하기 위해.

제안 방법

  • 복제 레이어는 단일 2D 실루엣에서 거친 3D 볼륨 분할을 생성하기 위해 단순한 2D에서 3D 볼륨 복제를 수행한다.
  • 스택드 계층적 네트워크 아키텍처는 다수의 단일 네트워크를 조합하여 점진적으로 3D 형태 재구성을 정밀하게 개선한다.
  • 종단 간 학습 전략은 스택드 네트워크를 통해 기울기 흐름을 제어하여, 사전 훈련이나 별도의 훈련 단계 없이 최종 네트워크 오차를 최소화한다.
  • 이 훈련 전략은 각 레이어의 병합 기준과 다름없이, 최종 네트워크 출력에 집중된 고유한 오차 최소화 기준을 적용한다.
  • 프레임워크는 각 물체 주변의 구면에서 무작위로 샘플링한 3,960개의 단일 뷰 실루엣으로 훈련된다.
  • 정답 3D 형태는 위치와 방향이 고정되어 있어 훈련 중에 회전/이동의 모호성을 방지한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 RGB 텍스처나 추가 감독 없이도 단일 뷰 이진 실루엣 이미지에서 고품질 3D 재구성을 달성할 수 있는가?
  • RQ2종단 간 학습이 적용된 스택드 계층적 네트워크 아키텍처가 실루엣 기반 3D 재구성에서 단일 네트워크보다 우월한가?
  • RQ3모델은 제한된 원형 또는 부분 구면 뷰가 아닌, 전체 구면 상에 무작위로 분포된 단일 뷰 실루엣으로도 일반화 가능한가?
  • RQ4IoU 측면에서 최신 기술 수준의 단일 뷰 RGB 이미지에서의 3D 재구성과 비교해 본다면, 제안된 방법은 어떻게 성능을 내는가?
  • RQ5어려운 재구성 어려운 실루엣 뷰에서 재구성 품질 향상은 일관되게 유지되는가?

주요 결과

  • 스택드 계층적 네트워크는 3D-R2N2보다 단일 뷰 RGB 이미지에서 더 높은 평균 IoU를 달성하며, 자동차와 항공기 각각 0.1과 0.07 향상됨.
  • 3,960개의 무작위로 위치한 단일 뷰 실루엣에 대해, 자동차 재구성의 74.87%와 항공기 재구성의 52.83%가 높은 IoU를 기록하여 강력한 일반화 능력을 보임.
  • 단일 네트워크보다 어려운 단일 뷰 실루엣 이미지에서 훨씬 높은 IoU를 보이며, 모든 테스트 케이스에서 일관된 향상이 이루어짐.
  • IoU 측정의 표준 오차는 약 10^-4이며, 결과의 통계적 신뢰도가 매우 높음을 확인함.
  • 제안된 방법은 단일 뷰 실루엣에서의 3D 재구성에서 최신 기술 수준의 성능을 달성하며, RGB 데이터로 훈련된 방법들조차도 IoU 측면에서 뛰어넘음.
  • 프레임워크는 구면 상에 넓고 무작위로 분포된 뷰에서 3D 형태를 성공적으로 재구성했으며, 이는 이전의 네트워크 프레임워크가 구현하지 못한 능력이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.