Skip to main content
QUICK REVIEW

[논문 리뷰] Learning a Disentangled Embedding for Monocular 3D Shape Retrieval and Pose Estimation

Kyaw Zaw Lin, Weipeng Xu|arXiv (Cornell University)|2018. 12. 24.
3D Shape Modeling and Analysis참고 문헌 41인용 수 8
한 줄 요약

이 논문은 3D 점유 격자에서 별개이면서 불변하는 형태 및 자세 벡터를 학습하여 단안 3D 형태 검색과 6자리 자세 추정을 동시에 수행하는 분리된 임베딩 네트워크를 제안한다. 이 방법은 형태와 자세 표현을 명시적으로 분리함으로써 편향을 감소시키고 일반화 능력을 향상시켜 Pascal3D+에서 0.592의 top-1 정확도와 10.3도의 중앙자세 오차를 기록하며 최신 기술 수준을 달성한다.

ABSTRACT

We propose a novel approach to jointly perform 3D shape retrieval and pose estimation from monocular images.In order to make the method robust to real-world image variations, e.g. complex textures and backgrounds, we learn an embedding space from 3D data that only includes the relevant information, namely the shape and pose. Our approach explicitly disentangles a shape vector and a pose vector, which alleviates both pose bias for 3D shape retrieval and categorical bias for pose estimation. We then train a CNN to map the images to this embedding space, and then retrieve the closest 3D shape from the database and estimate the 6D pose of the object. Our method achieves 10.3 median error for pose estimation and 0.592 top-1-accuracy for category agnostic 3D object retrieval on the Pascal3D+ dataset, outperforming the previous state-of-the-art methods on both tasks.

연구 동기 및 목표

  • 단안 영상에서 자세 변동성에 의한 3D 형태 검색의 과제를 해결하기 위해.
  • 실제 영상와 합성 훈련 데이터 간 도메인 갭을 줄이기 위해 렌더링된 영상 대신 3D 데이터에서 학습함으로써.
  • 공유된 임베딩 공간에서 형태와 자세 표현을 명시적으로 분리함으로써 일반화 능력을 향상시키기 위해.
  • 단일의 카테고리 무관 네트워크를 사용하여 3D 형태 검색과 6자리 자세 추정을 동시에 수행하기 위해.
  • 훈련 중에 CAD 모델의 다중 시점 렌더링과 자세 변형을 광범위하게 수행할 필요를 제거하기 위해.

제안 방법

  • 다양한 자세에서의 물체 3D 점유 격자에 대해 CNN을 훈련하여 별개의 형태 및 자세 벡터를 가진 분리된 임베딩 공간을 학습하기 위해.
  • 형태 벡터가 자세에 대해 불변하고 자세 벡터가 형태에 대해 불변하도록 보장하기 위해 대비 손실을 사용하기 위해.
  • 2D 영상에서의 이미지 특징을 분리된 형태 및 자세 임베딩 공간으로 회귀시키기 위해 두 번째 CNN을 훈련하기 위해.
  • 6자리 회전 표현 기반의 하이브리드 분류-회귀 전략을 적용하여 자세 추정 정확도를 향상시키기 위해.
  • 모든 자세 변형을 사전에 렌더링하지 않고, 임의의 자세로 3D 볼륨을 증강함으로써 온라인 방식으로 훈련 샘플을 생성하기 위해.
  • 형태 임베딩 공간에서 가장 가까운 이웃을 찾는 방식으로 검색을 수행하고, 자세는 자세 벡터에서 직접 추정하기 위해.

실험 결과

연구 질문

  • RQ1형태와 자세의 분리된 임베딩 공간은 자세 변동성에 대한 3D 형태 검색의 강건성 향상에 기여하는가?
  • RQ2형태와 자세의 분리된 학습을 통한 공동 학습은 자세 추정에서의 카테고리 편향을 감소시키는가?
  • RQ3렌더링된 영상 대신 3D 점유 격자에서 학습함으로써 실재 영상와 합성 데이터 간 도메인 이동을 완화하는가?
  • RQ4단일의 카테고리 무관 네트워크가 3D 검색과 자세 추정에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5이 방법은 차폐되거나 잘린, 또는 작은 물체와 같은 도전적인 경우에 어떻게 일반화되는가?

주요 결과

  • 이 방법은 카테고리에 관계없이 3D 형태 검색에서 0.592의 top-1 정확도를 기록하여 이전 최신 기술 수준의 방법을 능가한다.
  • Pascal3D+ 데이터셋에서 중앙자세 오차는 10.3도로, 이전 접근 방식에 비해 상당한 향상이다.
  • 자세가 잘린 경우와 차폐된 경우에서 성능 저하가 가장 심하며, 각각 top-1 정확도가 0.464와 0.498로 떨어진다.
  • 보트 카테고리에서는 자세 추정 오차가 가장 높으며, 140도를 초과하는 오차가 40% 이상 발생한다. 이는 앞뒤 구분의 모호성 때문일 가능성이 높다.
  • 실패 사례의 주요 원인은 작은, 흐릿하거나 모호한 물체이며, 데이터셋 내의 애매한 애너테이션도 영향을 미친다.
  • 분리된 표현은 다중 시점 렌더링이나 카테고리별 하위 네트워크 없이도 강건한 성능을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.