Skip to main content
QUICK REVIEW

[논문 리뷰] HiT-DVAE: Human Motion Generation via Hierarchical Transformer Dynamical VAE

Xiaoyu Bie, W. Guo|arXiv (Cornell University)|2022. 04. 04.
Human Pose and Action Recognition인용 수 7
한 줄 요약

HiT-DVAE는 3D 인간 운동 생성을 위한 계층적 트랜스포머 기반의 동적 변동 자동에코더를 제안한다. 어텐션 메커니즘을 통해 데이터 및 잠재 공간 내의 순차적 의존성을 모델링하여 다양하고 현실적이며 장기 예측이 가능한 운동 생성을 가능하게 한다. 다양한 지표에서 HumanEva-I 및 Human3.6M 데이터셋에서 최신 기술을 초월하며, 운동의 다양성, 정확성, 재구성 품질 측면에서 최고 성능을 기록한다.

ABSTRACT

Studies on the automatic processing of 3D human pose data have flourished in the recent past. In this paper, we are interested in the generation of plausible and diverse future human poses following an observed 3D pose sequence. Current methods address this problem by injecting random variables from a single latent space into a deterministic motion prediction framework, which precludes the inherent multi-modality in human motion generation. In addition, previous works rarely explore the use of attention to select which frames are to be used to inform the generation process up to our knowledge. To overcome these limitations, we propose Hierarchical Transformer Dynamical Variational Autoencoder, HiT-DVAE, which implements auto-regressive generation with transformer-like attention mechanisms. HiT-DVAE simultaneously learns the evolution of data and latent space distribution with time correlated probabilistic dependencies, thus enabling the generative model to learn a more complex and time-varying latent space as well as diverse and realistic human motions. Furthermore, the auto-regressive generation brings more flexibility on observation and prediction, i.e. one can have any length of observation and predict arbitrary large sequences of poses with a single pre-trained model. We evaluate the proposed method on HumanEva-I and Human3.6M with various evaluation methods, and outperform the state-of-the-art methods on most of the metrics.

연구 동기 및 목표

  • 기존 방법들이 단일 잠재 엔코딩을 사용하여 인간 운동 생성에서 다중모달성을 모델링하지 못하는 한계를 해결한다.
  • 기존 연구에서 운동 생성 중 관련 프레임을 선택하기 위한 어텐션 메커니즘이 부족한 점을 보완한다.
  • 단일 사전 훈련된 모델을 통해 관찰 길이와 예측 길이가 임의로 설정된 자기회귀적, 장기 시퀀스 운동 생성을 가능하게 한다.
  • 관측된 자세 시퀀스와 잠재 공간 분포 양쪽에서 시간에 따른 상관관계를 동시에 모델링하여 운동의 현실감과 다양성을 향상시킨다.
  • 동적 VAE와 트랜스포머 기반 어텐션을 조합한 계층적 아키텍처를 도입하여 복잡하고 시간에 따라 변화하는 잠재 표현을 학습한다.

제안 방법

  • 관측된 3D 자세와 시간에 따라 변화하는 잠재 변수 간의 복합 의존성을 모델링하는 계층적 트랜스포머 기반 아키텍처를 제안한다.
  • 각 시간 단계에서 시퀀스 수준의 잠재 변수 $ z_t $ 를 사용하여 시간 동적 특성을 포착하며, 단일 임베딩 인코딩을 동적 잠재 공간으로 대체한다.
  • 다음 자세를 예측하기 위해 관련된 과거 프레임에 주목하는 트랜스포머 유사 어텐션 메커니즘을 활용해 자기회귀적 생성을 구현한다.
  • 운동의 다양성을 향상시키기 위해 시간에 독립적인 잠재 변수 $ \mathbf{w} $ 를 도입하여 전역적 맥락에 따라 생성 과정을 조절한다.
  • 순차적 잠재 공간에서 재구성 오차와 KL 발산 항을 동시에 최적화하는 변동 추론 목표 함수를 사용해 모델을 훈련한다.
  • 학습 과정에서 스케줄링 샘플링을 적용하여 학습 안정성을 높이고 장기 시퀀스로의 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1계층적 트랜스포머 기반의 동적 VAE는 3D 인간 운동 시퀀스의 복잡한 시간 의존성을 효과적으로 포착할 수 있는가?
  • RQ2고정 또는 RNN 기반 어텐션과 비교해 어텐션 메커니즘을 사용할 경우 운동 생성을 위한 프레임 선택이 향상되는가?
  • RQ3모델은 평균 운동 패tern으로 수렴하지 않고 다양하고 현실적이며 장기 예측 가능한 운동 시퀀스를 생성할 수 있는가?
  • RQ4시간에 독립적인 잠재 변수 $ \mathbf{w} $ 를 포함할 경우 운동의 다양성과 생성 품질에 어떤 영향을 미치는가?
  • RQ5제안된 아키텍처는 운동의 다양성, 정확성, 부드러움 측면에서 기존 최신 기술 대비 어느 정도 뛰어난가?

주요 결과

  • HumanEva-I에서 HiT-DVAE는 72.6%의 동작 분류 정확도, 0.089 FID, 4.721 APD를 기록하여 모든 베이스라인을 압도하는 최고 성능을 달성한다.
  • Human3.6M에서 HiT-DVAE는 70.0%의 동작 정확도와 1.708 FID를 기록하여 최신 기술 대비 운동의 현실감과 다양성 측면에서 뛰어난 성능을 보였다.
  • 제거 실험 결과 어텐션 메커니즘 또는 $ \mathbf{w} $ 를 제거할 경우 성능 저하가 심하게 발생하며, 특히 다양성과 재구성 품질에 큰 영향을 미친다.
  • 스케줄링 샘플링을 적용하지 않은 모델은 더 다양한 운동을 생성하지만 품질은 낮아지며, 다양성과 충실도 사이의 상충 관계를 확인할 수 있다.
  • 어텐션 메커니즘과 $ \mathbf{w} $ 를 포함하지 않은 베이스라인 DVAE는 정적 잠재 상태로 수렴하여 제안된 계층적 및 어텐션 기반 설계의 必要성 을 입증한다.
  • 정성적 결과 분석에서 HiT-DVAE는 모든 샘플에서 다양하고 타당하며 현실적인 운동 시퀀스를 생성하는 것으로 확인되었으며, 반복적이거나 비자연스러운 운동을 생성하는 기존 방법들과는 대조된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.