Skip to main content
QUICK REVIEW

[논문 리뷰] DOVE: Learning Deformable 3D Objects by Watching Videos

Shangzhe Wu, Tomáš Jakab|arXiv (Cornell University)|2021. 07. 22.
3D Shape Modeling and Analysis참고 문헌 67인용 수 14
한 줄 요약

DOVE는 키포인트, 시점, 템플릿 감독 없이 단일 영상에서 변형 가능한 물체 카테고리의 세밀하고 질감 있는, 관절이 있는 3D 모델을 학습한다. 시간적 대응 관계를 활용하고 대칭으로 인한 자세 불확실성을 해결함으로써, 형태, 자세, 질감을 분리하여 테스트 시 단일 이미지에서 시간적으로 일관되고 애니메이션 가능한 3D 재구성을 달성한다.

ABSTRACT

Learning deformable 3D objects from 2D images is often an ill-posed problem. Existing methods rely on explicit supervision to establish multi-view correspondences, such as template shape models and keypoint annotations, which restricts their applicability on objects "in the wild". A more natural way of establishing correspondences is by watching videos of objects moving around. In this paper, we present DOVE, a method that learns textured 3D models of deformable object categories from monocular videos available online, without keypoint, viewpoint or template shape supervision. By resolving symmetry-induced pose ambiguities and leveraging temporal correspondences in videos, the model automatically learns to factor out 3D shape, articulated pose and texture from each individual RGB frame, and is ready for single-image inference at test time. In the experiments, we show that existing methods fail to learn sensible 3D shapes without additional keypoint or template supervision, whereas our method produces temporally consistent 3D models, which can be animated and rendered from arbitrary viewpoints.

연구 동기 및 목표

  • 키포인트, 시점, 템플릿 형태와 같은 명시적 기하학적 감독 없이, 정제되지 않은 단일 영상에서 3D 변형 가능한 물체 카테고리를 학습하는 것.
  • 다중 프레임 대응 관계를 통해 2D 이미지에서의 3D 재구성 문제의 불완전성 문제를 해결하기 위해 영상 시퀀스를 활용하는 것.
  • 계층적인 3D 모델에서 카테고리 수준의 형태 사전 지식, 인스턴스별 변형, 시간에 따라 변하는 관절 자세를 분리하는 것.
  • 단일 이미지에서 정확하고 시간적으로 일관된 3D 재구성 및 렌더링을 가능하게 하기 위해 영상 데이터로만 훈련된 모델을 활용하는 것.
  • 키포인트 및 템플릿 감독을 자가 감독 영상 학습으로 대체함으로써 고비용 수동 주석에 대한 의존도를 줄이는 것.

제안 방법

  • 수동 주석을 피하기 위해, 영상에서 2D 마스크와 대응 관계를 추출하기 위해 상용의 인스턴스 세그멘테이션 및 옵티컬 플로우 모델을 사용하는 것.
  • 각 프레임에서 두 가지 대칭 가설만을 고려함으로써 2D에서 3D로의 시점 불확실성을 해결하여, 이전 방법에 비해 검색 공간을 크게 줄이는 것.
  • 카테고리 수준의 형태 사전 지식, 인스턴스별 변형, 시간에 따라 변화하는 관절 자세를 분리하는 계층적인 3D 형태 표현을 활용하는 것.
  • 일관성 있는 형태와 일반화를 향상시키기 위해 기본 형태와 질감에 이중 대칭성을 강제 적용하는 것.
  • 영상 내 인스턴스별 대응 관계와 영상 간 인스턴스에 관계없이 적용 가능한 대응 관계를 활용하여 공통의 3D 사전 지식을 학습하는 것.
  • 영상 감독을 통해 일관성을 확보하고 단일 이미지에서 질감이 있는 관절이 있는 3D 메쉬를 예측하는 엔드 투 엔드 미분 가능한 모델을 훈련하는 것.

실험 결과

연구 질문

  • RQ12D 이미지에서의 3D 재구성 문제는 기하학적 감독 없이도 비정제된 영상에서 의미 있는 형태와 자세의 분리를 학습할 수 있는가?
  • RQ2키포인트나 템플릿 감독 없이도 영상의 대칭성과 시간적 일관성을 어떻게 활용하여 3D 시점 불확실성을 해결할 수 있는가?
  • RQ3영상 데이터로부터 카테고리 수준의 형태 사전 지식을 얼마나 잘 학습할 수 있으며, 이를 통해 미리 보지 않은 인스턴스의 재구성 성능을 얼마나 향상시킬 수 있는가?
  • RQ4영상 기반 훈련 방식은 단일 이미지 기반 방법에 비해 3D 형태 정확도와 시점 일반화 능력 측면에서 어떻게 비교되는가?
  • RQ5다양하고 자연스러운 영상으로 훈련된 모델은 단일 이미지에서 시간적으로 일관되고 애니메이션 가능한 3D 메쉬를 생성할 수 있는가?

주요 결과

  • 전체 DOVE 모델은 장난이야기 새 데이터셋에서 1.51 ± 0.89 cm의 Chamfer Distance를 기록하며, 분석된 변형 모델들보다 뚜렷이 뛰어난 성능을 보였다.
  • 이중 시점 불확실성 해결 기능을 제거할 경우 Chamfer Distance는 2.52 ± 1.41 cm로 증가하여, 자세 추정에서 이 기능의 핵심적 역할을 입증했다.
  • 대칭 제약 조건을 생략할 경우 Chamfer Distance는 2.19 ± 1.24 cm로 상승하여, 대칭성이 형태 복원에 강력한 사전 지식임을 시사했다.
  • 영상 훈련 없이 테스트할 경우 Chamfer Distance는 2.20 ± 1.03 cm로 증가하여, 영상이 물체의 전체 360도 기하학적 특성을 발견하는 데 중요한 역할을 함을 보여주었다.
  • 학습된 카테고리 수준의 형태 사전 지식을 제거할 경우 Chamfer Distance는 3.92 ± 1.47 cm로 상승하여, 공유된 형태의 인덕티브 바이어스가 유의미한 이점을 제공함을 입증했다.
  • 정성적 결과에서는 DOVE가 키포인트 감독이 필요한 기존 방법들과 달리, 일관되고 현실적인 3D 메쉬를 생성하여 임의의 시점에서 애니메이션 및 렌더링이 가능함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.