Skip to main content
QUICK REVIEW

[논문 리뷰] LASSIE: Learning Articulated Shapes from Sparse Image Ensemble via 3D Part Discovery

Chun-Han Yao, Wei-Chih Hung|arXiv (Cornell University)|2022. 07. 07.
Human Pose and Action Recognition인용 수 15
한 줄 요약

LASSIE는 2D/3D 레이블이나 사전 정의된 템플릿 없이, 오직 10~30장의 일상적 이미지에서 고품질의 3차원 관절형 동물 형태를 복원하기 위한 자체학습 프레임워크를 제안한다. 깊이 있는 특징 일관성과 기하학적 사전 지식을 통해 3차원 부위를 탐지하며, 최소한의 사용자 입력으로 최신 기술 수준의 3차원 복원 및 부위 탐지 성능을 달성한다.

ABSTRACT

Creating high-quality articulated 3D models of animals is challenging either via manual creation or using 3D scanning tools. Therefore, techniques to reconstruct articulated 3D objects from 2D images are crucial and highly useful. In this work, we propose a practical problem setting to estimate 3D pose and shape of animals given only a few (10-30) in-the-wild images of a particular animal species (say, horse). Contrary to existing works that rely on pre-defined template shapes, we do not assume any form of 2D or 3D ground-truth annotations, nor do we leverage any multi-view or temporal information. Moreover, each input image ensemble can contain animal instances with varying poses, backgrounds, illuminations, and textures. Our key insight is that 3D parts have much simpler shape compared to the overall animal and that they are robust w.r.t. animal pose articulations. Following these insights, we propose LASSIE, a novel optimization framework which discovers 3D parts in a self-supervised manner with minimal user intervention. A key driving force behind LASSIE is the enforcing of 2D-3D part consistency using self-supervisory deep features. Experiments on Pascal-Part and self-collected in-the-wild animal datasets demonstrate considerably better 3D reconstructions as well as both 2D and 3D part discovery compared to prior arts. Project page: chhankyao.github.io/lassie/

연구 동기 및 목표

  • 사전 정의된 템플릿이나 개체 수준의 레이블이 없이, 흩어진 일상적 이미지에서 세밀한 3차원 관절형 동물 형태를 복원하는 문제를 해결하기 위해.
  • 카테고리에 관계없이 뼈대 기반의 신경 부위 표현을 사용하여 다양한 동물 종에 일반화할 수 있도록 하기 위해.
  • 자세 변화와 외관 변화에 비추어 안정적으로 유지되는 의미론적이고 기하학적으로 일관된 3차원 부위를 탐지하기 위해.
  • 깊이 있는 특징과 기하학적 사전 지식을 활용하여 2D-3D 부위 일관성을 강제하는 자체학습 최적화 프레임워크를 개발하기 위해.
  • 명시적인 3차원 부위 표현을 통해 질감 이식, 자세 이식, 애니메이션 등의 후속 응용을 가능하게 하기 위해.

제안 방법

  • 사용자가 제공한 일반적인 3차원 뼈대를 활용하며, 이는 부위 간 연결성을 정의하지만 정확한 기하학적 형태나 뼈 길이는 포함하지 않는다.
  • DINO-ViT 특징을 사용하여 2D-3D 대응과 이미지 간 의미 일관성을 강제하는 자체학습 최적화를 통해 3차원 부위를 탐지한다.
  • 최적화된 3차원 부위가 단순 기하형태(예: 구, 실린더)로 구성된 잠재 형태 다양체에 제약을 두어 기하학적 정규화를 적용한다.
  • 공통 3차원 부위 형태, 개별 인스턴스의 카메라 자세, 뼈 변환, 표면 질감을 통합된 미분 가능 프레임워크에서 최적화한다.
  • DINO-ViT에서 유도한 밀도 높은 자체학습 특징을 사용하여 레이아웃 일관성과 의미 일관성을 강제하며, 지도 레이블 없이도 부위 탐지를 유도한다.
  • 2D 이미지 공간으로 3차원 부위를 투영하고 특징 매칭을 통한 최적화를 감독하기 위해 미분 가능 렌더링 파이프라인을 활용한다.

실험 결과

연구 질문

  • RQ12D 또는 3D 레이블이 전혀 없이, 오직 10~30장의 일상적 이미지에서 3차원 관절형 동물 형태를 복원할 수 있는가?
  • RQ2비전 트랜스포머에서 유도한 자체학습 깊이 특징이 3차원 부위 탐지에 효과적으로 기여하고 2D-3D 일관성을 강제할 수 있는가?
  • RQ3간단한 3차원 기하형태에 대한 기하학적 사전 지식이 복원된 부위의 품질과 현실성 향상에 기여하는가?
  • RQ4탐지된 3차원 부위 표현이 질감 이식 및 자세 이식과 같은 고품질 응용을 지원할 수 있는가?
  • RQ5최소한의 사용자 입력으로 다양한 동물 종에 대해 이 프레임워크가 얼마나 잘 일반화되는가?

주요 결과

  • LASSIE는 Pascal-Part 벤치마크에서 최신 기술 수준의 3차원 복원 품질을 달성하며, 더 강력한 감독 정보를 가진 기존 방법들조차도 앞서고 있다.
  • SCOPS 및 DINO 클러스터링과 비교해 더 높은 2D 부위 세그먼테이션 IOU를 기록했으며, 더 나은 의미론적 일치와 부위 분리(예: 네 개의 다리 식별)를 보였다.
  • 부위 이식 평가에서 이미지 쌍 간에 높은 PCP(정확한 픽셀 비율)를 기록하여 강력한 3차원 부위 일관성과 이식 가능성의 우수함을 입증했다.
  • 3차원 신경 부위 표현은 도식 6에서 보여지듯이, 서로 다른 동물 종 간에 현실적인 질감 이식과 자세 이식을 가능하게 했다.
  • LASSIE는 명시적이고 조작 가능한 부위를 갖춘 고품질의 기하학적으로 정교한 3차원 형태를 생성하며, 애니메이션 및 편집과 같은 응용을 가능하게 했다.
  • 최소한의 사용자 간섭으로 다양한 동물 종에 걸쳐 수집한 일상적 이미지 세트에 대해 프레임워크가 잘 일반화됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.