Skip to main content
QUICK REVIEW

[논문 리뷰] Neural View Synthesis and Matching for Semi-Supervised Few-Shot Learning of 3D Pose

Angtian Wang, Shenxiao Mei|arXiv (Cornell University)|2021. 10. 27.
Human Pose and Action Recognition참고 문헌 56인용 수 5
한 줄 요약

이 논문은 신경 시각 합성 및 매칭(NVSM)을 사용하여 소수의 레이블이 부여된 이미지에서 비레이블 데이터로 3D 자세 애너테이션을 전이하는 반감독적 소수 샘플 3D 자세 추정 프레임워크를 제안한다. 이는 새로운 3D 시점의 특징 맵을 합성하고 이를 공간적으로 매칭함으로써 구현된다. 이 방법은 특히 7장의 레이블이 부여된 이미지에서 최신 기술 성능(SOTA)을 달성하며, 대조 학습을 통한 반복적 특징 개선을 통해 부분적 가림과 큰 자세 변화에 대해 강력한 내성성을 보여준다.

ABSTRACT

We study the problem of learning to estimate the 3D object pose from a few labelled examples and a collection of unlabelled data. Our main contribution is a learning framework, neural view synthesis and matching, that can transfer the 3D pose annotation from the labelled to unlabelled images reliably, despite unseen 3D views and nuisance variations such as the object shape, texture, illumination or scene context. In our approach, objects are represented as 3D cuboid meshes composed of feature vectors at each mesh vertex. The model is initialized from a few labelled images and is subsequently used to synthesize feature representations of unseen 3D views. The synthesized views are matched with the feature representations of unlabelled images to generate pseudo-labels of the 3D pose. The pseudo-labelled data is, in turn, used to train the feature extractor such that the features at each mesh vertex are more invariant across varying 3D views of the object. Our model is trained in an EM-type manner alternating between increasing the 3D pose invariance of the feature extractor and annotating unlabelled data through neural view synthesis and matching. We demonstrate the effectiveness of the proposed semi-supervised learning framework for 3D pose estimation on the PASCAL3D+ and KITTI datasets. We find that our approach outperforms all baselines by a wide margin, particularly in an extreme few-shot setting where only 7 annotated images are given. Remarkably, we observe that our model also achieves an exceptional robustness in out-of-distribution scenarios that involve partial occlusion.

연구 동기 및 목표

  • 최소한의 인간 애너테이션 데이터를 가진 3D 자세 추정 문제에 대응하기 위해, 특히 소수 샘플 및 반감독 설정에서의 과제를 해결한다.
  • 텍스처, 조명, 가림과 같은 혼란 인자와 함께 큰 자세 변화가 존재하는 상황에서도 소수의 레이블이 부여된 이미지에서 3D 자세 애너테이션을 대규모 비레이블 이미지로 신뢰성 있게 전이할 수 있도록 한다.
  • 비레이블 데이터에 대한 가짜 레이블을 사용하여 반복적으로 특징 추출기의 품질을 향상시킴으로써 3D 객체 자세 변화에 대한 특징 불변성을 향상시킨다.

제안 방법

  • 객체는 각 정점에 학습 가능한 특징 벡터를 가진 3D 상자 메쉬로 표현되며, 이는 실제 3D 자세가 알려진 소수의 레이블이 부여된 이미지에서 초기화된다.
  • 신경 시각 합성은 메쉬를 회전시키고 레이블이 부여된 이미지의 CNN 특징에서 샘플된 특징 벡터를 래스터라이즈하여 새로운 3D 시점의 특징 맵을 생성한다.
  • 합성된 특징 맵과 비레이블 이미지의 특징 간 공간적 매칭을 수행하여 매칭 점수에 기반해 비레이블 이미지에 가짜 레이블을 할당한다.
  • 가짜 레이블이 부여된 데이터에 대해 대조 손실을 적용하여 서로 다른 3D 자세에서 대응하는 메쉬 정점 간의 특징 유사성을 강제함으로써 자세 불변성을 향상시킨다.
  • 가짜 레이블 생성과 특징 추출기의 개선을 반복적으로 수행하는 EM 유사 반복 최적화 프로세스를 통해 프레임워크가 작동한다.
  • 초기 특징 추출을 위해 사전 훈련된 ImageNet CNN 백본을 사용하며, 이는 합성 및 매칭된 특징에 대해 대조 학습을 통해 미세조정된다.

실험 결과

연구 질문

  • RQ1큰 자세 변화와 혼란 인자 존재 하에 소수의 레이블이 부여된 이미지에서 대규모 비레이블 이미지로 3D 자세 애너테이션을 신뢰성 있게 전이할 수 있는가?
  • RQ23D 자세 변화에 대해 특징 표현을 어떻게 불변성 있게 만들 수 있으며, 정확한 자세 추정을 위해 구분 능력을 유지할 수 있는가?
  • RQ3단 7개의 레이블 예시만 존재하는 상황에서 반감독 프레임워크가 소수 샘플 3D 자세 추정 성능을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 방법이 부분적 가림과 같은 분포 외 시나리오에 대해 일반화되어 강건하게 작동하는가?
  • RQ5가짜 레이블 생성과 대조 학습을 통한 반복적 개선이 훈련 에포크 수에 따라 특징 품질과 자세 추정 정확도를 어떻게 향상시키는가?

주요 결과

  • 제안된 NVSM 프레임워크는 PASCAL3D+ 및 KITTI 데이터셋에서 최신 기술 성능(SOTA)을 달성하며, 특히 단 7장의 레이블이 부여된 극한의 소수 샘플 설정에서 뛰어난 성능을 보였다.
  • 7장의 레이블이 부여된 이미지에서 기존의 모든 베이스라인보다 뚜렷이 뛰어난 성능을 보이며, 저자료 환경에서 반감독 학습 파라다임의 효과성을 입증했다.
  • 부분적 가림에 대해 뛰어난 내성성을 보이며, 객체가 상당히 가려져 있어도 높은 정확도를 유지했다.
  • 훈련 과정에서 공간적 매칭 품질이 크게 향상되었으며, 첫 20 에포크 내에 성능이 급격히 상승하여 효과적인 특징 학습이 이루어졌음을 시사했다.
  • PCA를 통한 특징 시각화 결과, 대조 손실이 유도하는 바와 같이, 객체 인식 가능한 표현과 공간적으로 일관되며 정점 간에 구분 가능한 특징을 학습한 특징 추출기가 학습되었음을 확인했다.
  • 대조 손실이 서로 다른 자세에서 대응하는 메쉬 정점 간의 특징 유사성을 효과적으로 유도하면서도, 서로 다른 정점 간의 구별성을 유지하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.