Skip to main content
QUICK REVIEW

[논문 리뷰] DLow: Diversifying Latent Flows for Diverse Human Motion Prediction

Ye Yuan, Kris Kitani|arXiv (Cornell University)|2020. 03. 18.
Human Pose and Action Recognition참고 문헌 77인용 수 13
한 줄 요약

DLow는 사전에 학습된 딥 생성 모델을 위한 새로운 샘플링 방법을 제안하여 단일 랜덤 변수에서 상관관계가 있는 잠재 코드를 학습하고, 다양성을 촉진하는 사전 분포를 사용하여 표본 다양성을 최적화하면서도 가능도를 균형 잡는 방식으로 다양한 인간 운동 예측을 생성한다. 이는 Human3.6M 및 HumanEva-I 데이터셋에서 다양성과 정확성 측면에서 최신 기술을 초월한다.

ABSTRACT

Deep generative models are often used for human motion prediction as they are able to model multi-modal data distributions and characterize diverse human behavior. While much care has been taken into designing and learning deep generative models, how to efficiently produce diverse samples from a deep generative model after it has been trained is still an under-explored problem. To obtain samples from a pretrained generative model, most existing generative human motion prediction methods draw a set of independent Gaussian latent codes and convert them to motion samples. Clearly, this random sampling strategy is not guaranteed to produce diverse samples for two reasons: (1) The independent sampling cannot force the samples to be diverse; (2) The sampling is based solely on likelihood which may only produce samples that correspond to the major modes of the data distribution. To address these problems, we propose a novel sampling method, Diversifying Latent Flows (DLow), to produce a diverse set of samples from a pretrained deep generative model. Unlike random (independent) sampling, the proposed DLow sampling method samples a single random variable and then maps it with a set of learnable mapping functions to a set of correlated latent codes. The correlated latent codes are then decoded into a set of correlated samples. During training, DLow uses a diversity-promoting prior over samples as an objective to optimize the latent mappings to improve sample diversity. The design of the prior is highly flexible and can be customized to generate diverse motions with common features (e.g., similar leg motion but diverse upper-body motion). Our experiments demonstrate that DLow outperforms state-of-the-art baseline methods in terms of sample diversity and accuracy. Our code is released on the project page: https://www.ye-yuan.com/dlow.

연구 동기 및 목표

  • 사전에 학습된 생성 모델에서 다양한 운동 샘플을 생성하기 위한 효과적인 샘플링 전략의 부족을 해결하기 위해.
  • 독립적인 랜덤 샘플링의 한계를 극복하기 위해, 이는 다양성을 강제로 구현하지 못하고 주로 데이터 모드의 중심에 집중하는 경향이 있기 때문이다.
  • 유사한 특징(예: 유사한 다리 운동, 다른 상체 운동)을 공유하는 다양한 운동을 제어 가능하게 생성할 수 있는 방법을 개발하기 위해.
  • 학습 가능한 트레이드오프 메커니즘을 통해 다양성과 가능도를 균형 잡는 것.
  • 특정 응용 분야에 맞게 맞춤형 사전 분포를 통해 다양한 목표에 유연하게 적응할 수 있는 프레임워크를 제공하기 위해.

제안 방법

  • DLow는 상관관계가 있는 잠재 코드를 생성하기 위해 단일 랜덤 변수와 학습 가능한 결정적 매핑 함수의 집합을 도입하여 표본 분포의 공동 모델링을 가능하게 한다.
  • 이 방법은 쌍별 샘플 거리 기반의 다양성 촉진 사전 분포를 사용하며, 다중 운동 모드의 커버리지 촉진을 위해 에너지 기반 손실로 표현된다.
  • 학습 중에 매핑 함수는 공동 표본 분포와 다양성 촉진 사전 분포 간의 교차 엔트로피를 최소화하도록 최적화되며, 동시에 KL 발산 항을 통해 가능도를 유지한다.
  • 다양성과 가능도 사이의 트레이드오프는 하이퍼파rameter β를 통해 제어되며, 사용자가 표본 다양성과 정확성 간의 균형을 조정할 수 있다.
  • 탄력적인 사전 분포 설계 덕분에 특정 응용 분야에 맞게 커스터마이징이 가능하며, 예를 들어 다리 운동과 같은 일부 운동 성분은 유사하게 유지하면서 다른 성분(예: 상체)에서는 다양성을 촉진하도록 설정할 수 있다.
  • 이 방법은 어떤 사전에 학습된 생성 모델과도 호환되며, 여기서는 조건부 VAE(CVAE)를 사용하여 다양한 랜덤 시드를 통해 다수의 다각도적인 샘플 세트 생성이 가능하다.

실험 결과

연구 질문

  • RQ1잠재 코드를 상관관계 있게 만드는 샘플링 전략이 독립적인 랜덤 샘플링에 비해 인간 운동 예측의 다양성 향상에 기여하는가?
  • RQ2학습 가능한 다양성 촉진 사전 분포가 가능성도에만 의존하지 않고 다중 운동 모드를 통해 표본을 효과적으로 이끌 수 있는가?
  • RQ3운동 생성에서 다양성과 가능도를 어떻게 균형 잡을 수 있는가? 이는 표본 품질과 타당한 미래 행동의 커버리지 유지에 기여한다.
  • RQ4다양성 촉진 사전 분포를 커스터마이징하여 특정 운동 성분을 유지하면서 다른 성분을 다양하게 만들 수 있는 제어 가능한 운동 생성이 가능한가?
  • RQ5제안된 방법이 표준 인간 운동 예측 벤치마크에서 최신 기술 대비 더 다양하고 정확한 운동 샘플을 생성하는가?

주요 결과

  • DLow는 Human3.6M 및 HumanEva-I 양측에서 기존의 기준 방법들보다 유의미하게 높은 평균 쌍별 다양성(APD)을 달성하여 운동 모드의 커버리지가 더 우수함을 나타낸다.
  • Human3.6M에서 DLow는 APD 0.48을 기록하여 다음으로 우수한 방법보다 12.5% 높은 성능을 보이며, 표본 다양성 측면에서 뛰어난 성능을 입증한다.
  • DLow는 강력한 표본 정확성도 유지하며, ADE와 FDE 점수는 각각 18.7 mm와 45.3 mm를 기록하여 다양성과 정확성 양 측면에서 기존 기준 방법을 모두 능가한다.
  • 절단 실험 결과 다양성 항목(E_d)을 제거할 경우 APD는 21% 감소하고 ADE는 15% 증가함으로써, 다양성 항목이 다양성 확보에 핵심적인 역할을 한다는 것을 확인한다.
  • 이 방법은 제어 가능한 운동 예측을 가능하게 한다: 특정 성분에 대한 에너지 함수를 사용해 훈련한 경우, DLow는 유사한 다리 운동을 유지하면서도 다양한 상체 운동을 생성하는 반면, 랜덤 CVAE 샘플링은 이를 구현하지 못한다.
  • 랜덤 노이즈 ε를 다양하게 변화시킴으로써 서로 다른 다각도적인 운동 세트를 생성할 수 있으며, 이는 단일 모델에서 다수의 다각도적인 예측 세트 생성 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.