Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Human Motion Estimation via Motion Compression and Refinement

Zhengyi Luo, S. Alireza Golestaneh|arXiv (Cornell University)|2020. 08. 09.
Human Pose and Action Recognition참고 문헌 51인용 수 10
한 줄 요약

이 논문은 두 단계로 구성된 3D 인간 운동 추정 방법인 MEVA를 제안한다. 먼저 변분 오토에인드어(Variational Autoencoder, VAE)를 사용하여 영상 시퀀스를 부드럽고 일반적인 운동 표현으로 압축한 후, 개인별 특화된 회귀모형을 통해 세부 운동 정보를 보정한다. 이 방법은 3DPW에서 가속도 오차를 54.3% 감소시켜 정확하고 시간적으로 부드러운 3D 자세 시퀀스를 제공한다.

ABSTRACT

We develop a technique for generating smooth and accurate 3D human pose and motion estimates from RGB video sequences. Our method, which we call Motion Estimation via Variational Autoencoder (MEVA), decomposes a temporal sequence of human motion into a smooth motion representation using auto-encoder-based motion compression and a residual representation learned through motion refinement. This two-step encoding of human motion captures human motion in two stages: a general human motion estimation step that captures the coarse overall motion, and a residual estimation that adds back person-specific motion details. Experiments show that our method produces both smooth and accurate 3D human pose and motion estimates.

연구 동기 및 목표

  • 최신 기술의 3D 인간 운동 추정에서 시간적 부드러움의 부족을 해결하기 위해, 각 관절의 정확도는 높지만 시간적 부드러움이 떨어지는 문제를 해결한다.
  • 운동 추정을 총괄적인(일반적인) 성분과 세부적인(개인별) 성분으로 분해하여 더 자연스럽고 정확한 결과를 도출한다.
  • 부드럽고 공유되는 인간 운동과 개인별 운동 변형을 분리하는 분리된 운동 표현을 학습한다.
  • 공간 정확도를 희생시키지 않은 채로 3D 자세 시퀀스에서 진동이나 비자연스러운 운동 아티팩트를 줄인다.

제안 방법

  • AMASS 데이터셋을 기반으로 변분 오토에인드어(VAE)를 학습하여 부드럽고 일반적인 인간 운동을 나타내는 저차원 잠재공간을 학습한다.
  • 예측의 정확도를 높이기 위해 데이터 증강 기법(임의의 루트 회전, 프레임 속도 변화, 좌우 반전)을 사용해 VAE를 미세조정한다.
  • VAE의 잠재 코드를 복원함으로써 총괄적인 운동 추정을 생성하여 전체적인 부드러운 운동 경로를 표현한다.
  • 운동 보정 회귀모형(Motion Refinement Regressor, MRR)을 학습하여 영상 프레임의 이미지 증거를 기반으로 총괄 추정에서의 잔차 오프셋을 예측한다.
  • 최종 3D 자세 시퀀스는 VAE가 생성한 총괄 운동에 MRR가 예측한 잔차를 더함으로써 도출된다.
  • 전체 프레임워크는 두 단계로 학습되며, 먼저 VAE를 사전학습하고, 그 후 고정된 VAE 위에 MRR를 함께 학습한다.

실험 결과

연구 질문

  • RQ1두 단계로 구성된 운동 추정 프레임워크는 3D 인간 자세 추정에서 공간 정확도를 저하시키지 않으면서도 시간적 부드러움을 향상시킬 수 있는가?
  • RQ2VAE 기반의 운동 압축 단계가 일반적인 인간 운동의 본질적 부드러움을 얼마나 잘 포착하는가?
  • RQ3개인별 특화된 보정 모듈은 일반 운동 모델이 포착하지 못한 운동 세부 정보를 얼마나 잘 복원할 수 있는가?
  • RQ4사전학습된 VAE 잠재공간을 사용할 경우, 엔드 투 엔드 학습 대비 일반화 능력 향상과 운동학적으로 타당하지 않은 자세의 감소에 기여하는가?

주요 결과

  • MEVA는 기존 최고 성능 기술 대비 3DPW 데이터셋에서 가속도 오차를 54.3% 감소시켜 운동의 부드러움을 크게 향상시켰다.
  • 절단 실험 결과, 사전학습된 VAE를 사용할 경우 더 안정적이고 자연스러운 운동 시퀀스를 도출할 수 있었으며, 엔드 투 엔드 학습에서 관찰된 운동학적으로 타당하지 않은 자세를 피할 수 있었다.
  • 단순히 변분 운동 추정기(Variational Motion Estimator, VME)만 학습하는 것만으로도 HMMR(기존 최고 성능 방법)와 유사한 가속도 오차 성능을 달성했다.
  • VAE 사전학습 중 루트 회전, 프레임 속도 변화, 좌우 반전 등의 데이터 증강 기법을 적용함으로써, 예측되지 않은 3DPW 시퀀스에서 VAE 재구성 오차가 최대 70%까지 감소했다.
  • MEVA는 3DPW에서 PA-MPJPE 54.7을 기록하여 정확도와 부드러움 모두에서 기존 방법을 능가했다.
  • 시각화 결과, 총괄 운동은 전반적인 운동 경향을 잘 포착하는 반면, 잔차 보정은 갑작스러운 팔 흔들림이나 머리 회전과 같은 동적이고 개인별 특화된 세부 정보를 회복함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.