Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Variational Motion Prior for Video-based Motion Capture

Xin Chen, Zhuo Su|arXiv (Cornell University)|2022. 10. 27.
Advanced Vision and Imaging인용 수 5
한 줄 요약

이 논문은 대규모 3D 모션 캡처 데이터를 기반으로 한 트랜스포머 기반 변분 오토에인코더를 통해 학습된 변분 운동 사전(VMP)을 제안하여 단일 영상 기반 인간 운동 캡처의 성능을 향상시킨다. 연속적인 잠재 공간에서 전체적인 시퀀스 수준의 운동 사전를 모델링하고 영상 인코더와 통합하여 엔드 투 엔드 미세조정을 수행함으로써, 3DPW에서 10mm 이상의 오차 감소를 달성하고, 벤치마크 및 실외 환경 설정 모두에서 최신 기술 수준의 성능을 확보한다.

ABSTRACT

Motion capture from a monocular video is fundamental and crucial for us humans to naturally experience and interact with each other in Virtual Reality (VR) and Augmented Reality (AR). However, existing methods still struggle with challenging cases involving self-occlusion and complex poses due to the lack of effective motion prior modeling. In this paper, we present a novel variational motion prior (VMP) learning approach for video-based motion capture to resolve the above issue. Instead of directly building the correspondence between the video and motion domain, We propose to learn a generic latent space for capturing the prior distribution of all natural motions, which serve as the basis for subsequent video-based motion capture tasks. To improve the generalization capacity of prior space, we propose a transformer-based variational autoencoder pretrained over marker-based 3D mocap data, with a novel style-mapping block to boost the generation quality. Afterward, a separate video encoder is attached to the pretrained motion generator for end-to-end fine-tuning over task-specific video datasets. Compared to existing motion prior models, our VMP model serves as a motion rectifier that can effectively reduce temporal jittering and failure modes in frame-wise pose estimation, leading to temporally stable and visually realistic motion capture results. Furthermore, our VMP-based framework models motion at sequence level and can directly generate motion clips in the forward pass, achieving real-time motion capture during inference. Extensive experiments over both public datasets and in-the-wild videos have demonstrated the efficacy and generalization capability of our framework.

연구 동기 및 목표

  • 자기 음영 및 복잡한 자세 상황에서 단일 영상 기반 운동 캡처에서 불안정하고 진동하는 3D 자세 추정 문제를 해결하기 위해.
  • 프레임 수준 또는 동작 조건 기반 사전을 초월하여 인간 운동의 전반적인 시간적 특성을 반영하는 일반화된 시퀀스 수준의 운동 사전를 학습하기 위해.
  • 사전 훈련된 잠재 운동 사전를 정규화 요소로 활용하여 실외 영상에 대한 일반화 능력과 현실감을 향상시키기 위해.
  • 단일 순방향 전파로 전체 운동 클립을 직접 생성함으로써 실시간 운동 캡처를 가능하게 하기 위해.
  • 작업 특화 감독에 대한 의존도를 줄이기 위해, 영상-운동 쌍 없이 대규모 마커 기반 모션 캡처 데이터에서 사전 훈련된 운동 사전를 학습하기 위해.

제안 방법

  • AMASS 데이터셋에서 트랜스포머 기반 변분 오토에인코더(VAE)를 훈련하여 자연스러운 인간 운동 시퀀스의 분포를 나타내는 연속적이고 표현력 있는 잠재 공간을 학습한다.
  • 적응형 인스턴스 정규화(AdaIN)를 사용한 새로운 스타일 매핑 블록이 잠재 코드의 표현력과 생성 품질을 향상시킨다.
  • 공간-시간 트랜스포머 아키텍처를 갖춘 별도의 영상 인코더를 엔드 투 엔드로 미세조정하여 입력 영상 클립을 사전 훈련된 VMP 잠재 공간으로 매핑한다.
  • 훈련 안정성과 자세 정확도 향상을 위해 KL 발산, 재구성 손실, 사지 길이 정규화를 조합한 다중 손실 훈련 목표를 사용한다.
  • 두 단계 훈련 전략은 사전 학습과 영상 특화 적응을 분리하여, 새로운 동작과 복잡한 운동에 대한 강력한 일반화 능력을 가능하게 한다.
  • VMP는 운동 정규화 요소로 기능하여 시간적 진동을 줄이고 프레임 단위 자세 추정의 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1시퀀스 수준의 연속 잠재 운동 사전는 단일 영상 기반 3D 운동 캡처의 안정성과 현실감을 향상시킬 수 있는가?
  • RQ2AdaIN 스타일 매핑을 갖춘 트랜스포머 기반 VAE는 복잡한 인간 운동 역학을 얼마나 효과적으로 모델링하는가?
  • RQ3사전 훈련된 운동 사전는 새로운 동작과 실외 영상 시나리오에 얼마나 잘 일반화되는가?
  • RQ4운동 사전는 반복 최적화 없이도 실시간으로 전체 운동 클립을 생성할 수 있는가?
  • RQ5VMP 기반 프레임워크는 도전적인 벤치마크에서 정확도와 일반화 능력 측면에서 기존의 운동 사전 모델을 초월하는가?

주요 결과

  • 제안된 VMP 프레임워크는 기준선 방법 대비 3DPW 벤치마크에서 PA-MPJPE를 10mm 이상 감소시켜 최신 기술 수준의 성능을 달성했다.
  • 사용자 연구 결과, 운동 자연스러움에 대한 평균 의견 점수(MOS)는 3.99로 ACTOR 대비 1.5점 향상되었으며, 더 뛰어난 시각적 품질을 입증했다.
  • 절단 실험 결과, AdaIN 블록과 비선형 매핑 구성 요소가 모두 필수적임을 확인하였으며, 이들의 제거는 각각 MOS를 3.74와 3.73로 낮춘다.
  • 프레임워크는 단일 순방향 전파로 전체 운동 클립을 생성하여 반복적 보정 없이 실시간 추론를 구현한다.
  • 전역 궤적 감독 없이도 VMP 기반 시스템은 VIBE와의 비교에서 타당한 전역 운동 궤적을 예측함을 보여주었다.
  • 잠재 공간의 연속성과 표현력 덕분에, 피트니스와 발레 간 전환과 같은 새로운 동작에 대해 잘 일반화됨을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.