Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Hand Pose Estimation using Simulation and Partial-Supervision with a Shared Latent Space

Masoud Abdi, Ehsan Abbasnejad|arXiv (Cornell University)|2018. 07. 14.
Human Pose and Action Recognition참고 문헌 30인용 수 8
한 줄 요약

이 논문은 VAE-GAN 하이브리드와 사이클 일致성 제약 조건을 사용하여 합성 깊이 영상, 실제 깊이 영상, 3D 손 자세 간의 공유 잠재 공간을 학습하는 LSPS라는 새로운 3D 손 자세 추정 방법을 제안한다. 합성 데이터와 부분적으로 레이블이 붙은 실제 데이터를 모두 활용함으로써, 모델은 뉴욕 대학교(NYU)에서 15.83mm, ICVL에서 14.09mm로 오차를 줄여 기존 방법 대비 최대 35%까지 정확도를 향상시켰으며, 이는 완전한 지도 학습에 가까운 성능을 달성한 것이다.

ABSTRACT

Tremendous amounts of expensive annotated data are a vital ingredient for state-of-the-art 3d hand pose estimation. Therefore, synthetic data has been popularized as annotations are automatically available. However, models trained only with synthetic samples do not generalize to real data, mainly due to the gap between the distribution of synthetic and real data. In this paper, we propose a novel method that seeks to predict the 3d position of the hand using both synthetic and partially-labeled real data. Accordingly, we form a shared latent space between three modalities: synthetic depth image, real depth image, and pose. We demonstrate that by carefully learning the shared latent space, we can find a regression model that is able to generalize to real data. As such, we show that our method produces accurate predictions in both semi-supervised and unsupervised settings. Additionally, the proposed model is capable of generating novel, meaningful, and consistent samples from all of the three domains. We evaluate our method qualitatively and quantitively on two highly competitive benchmarks (i.e., NYU and ICVL) and demonstrate its superiority over the state-of-the-art methods. The source code will be made available at https://github.com/masabdi/LSPS.

연구 동기 및 목표

  • 실제 3D 손 자세 데이터의 레이블링 비용이 높다는 문제를 해결하기 위해 합성 데이터와 제한된 실제 레이블을 조합한다.
  • 일般화를 방해하는 경향이 있는 합성 및 실제 깊이 영상 간의 도메인 갭을 해소한다.
  • 합성 깊이, 실제 깊이, 3D 손 자세의 세 가지 모odal 간에 공유 잠재 표현을 학습하는 통합 생성 모델을 개발한다.
  • 공유 잠재 공간을 이용해 세 도메인 간 일致성 있고 의미 있는 샘플을 제로샷 생성할 수 있도록 한다.
  • 실제 벤치마크에서 준지도 및 무지도 학습 설정에서 뛰어난 일반화 능력과 강건성을 입증한다.

제안 방법

  • 실제 및 합성 깊이 영상 도메인을 모델링하기 위해 두 개의 VAE-GAN 하이브리드를 사용하며, 쌍화되지 않은 데이터로도 분리된 공유 표현을 학습한다.
  • 3D 손 자세 도메인은 별도의 VAE로 모델링하며, 가중치 공유 및 사이클 일치성 제약 조건을 통해 세 도메인 간 공유 잠재 공간을 강제한다.
  • 잠재 공간을 정렬하기 위해 사후 추정 함수(P)와 매핑 함수(M)를 사용하여 도메인 간 번역을 가능하게 한다.
  • 쌍화되지 않은 실제 및 합성 깊이 영상 간의 사이클 일치성 손실을 통해, 공유 공간을 통한 인코딩-디코딩 과정에서 구조적 일致성을 유지한다.
  • 무지도 학습(합성 데이터 및 레이블이 없는 실제 데이터만 사용)과 준지도 미세조정(소량의 레이블이 붙은 실제 데이터 사용)을 모두 지원한다.
  • 공유 잠재 공간에서 사전 노이즈(예: 𝒩(0, I))를 디코딩함으로써 생성 샘플링을 가능하게 하며, 세 도메인 모두에서 현실적인 샘플을 생성한다.

실험 결과

연구 질문

  • RQ1합성 깊이 영상, 실제 깊이 영상, 3D 손 자세 간의 공유 잠재 공간이 합성 데이터에서 실제 데이터로의 일반화를 향상시키는가?
  • RQ2소량의 레이블이 붙은 실제 데이터만을 사용하는 준지도 설정에서 제안된 방법의 효과는 어떠한가?
  • RQ3공유 잠재 공간이 세 도메인 간에 일관되고 의미 있는 샘플을 얼마나 잘 생성하는가?
  • RQ4기존 최고 성능(SOTA) 방법에 비해 표준 벤치마크(NYU 및 ICVL)에서 모델 성능이 뛰어나게 되는가?
  • RQ5합성 및 실제 데이터 분포 간 큰 도메인 갭을 어떻게 다루는가?

주요 결과

  • NYU 데이터셋에서 제안된 방법은 평균 3D 오차가 15.83mm로, 실제 데이터에 대한 완전한 지도 학습 성능에 매우 가까운 결과를 달성했다.
  • ICVL 데이터셋에서 오차는 14.09mm로 줄었으며, 합성 데이터로만 학습한 경우(23.91mm 오차)보다 뚜렷이 뛰어난 성능을 보였다.
  • SOTA 기준선 대비 NYU에서 40mm 이내 오차를 가진 프레임 수가 19% 절대적으로 향상되었고, ICVL에서는 35% 향상되었다.
  • 실제 데이터의 10%만 레이블이 붙어 있을 때, 모델은 지도 학습 기준선 대비 17% 상대적 향상과 crossingNet의 준지도 방법 대비 10% 향상을 보였다(NYU 기준).
  • 모델는 세 도메인 모두에서 고품질이고 일관된 샘플을 생성하며, 사전 노이즈에서부터도 생성 가능함으로써 매끄럽고 의미 있는 잠재 공간을 보여주었다.
  • 정성적 결과에서 합성 데이터와 실제 데이터를 함께 사용할 경우 예측 정확도가 뚜렷이 향상되었으며, 특히 합성 데이터만으로는 실패하는 영역에서 뚜렷한 개선이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.