Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Future Net: Diversified Human Motion Generation

Wenheng Chen, He Wang|arXiv (Cornell University)|2020. 08. 25.
Human Pose and Action Recognition참고 문헌 38인용 수 4
한 줄 요약

이 논문은 잠재 공간 내에서 과거 및 미래 상태 표현을 활용하여 단기 및 장기 운동의 확률적 특성을 명시적으로 모델링하는 딥 생성 모델인 동적 미래 네트워크(Dynamic Future Net, DFN)를 제안한다. 최소한의 운동 데이터(최소 7초)로 훈련된 DFN은 임의의 지속 시간을 가진 다양하고 고품질이며 시간적으로 일관된 인간 운동 시퀀스를 생성하며, 분포 기반 손실 함수를 통해 기존 방법에 비해 다양성과 강건성 면에서 뛰어나다.

ABSTRACT

Human motion modelling is crucial in many areas such as computer graphics, vision and virtual reality. Acquiring high-quality skeletal motions is difficult due to the need for specialized equipment and laborious manual post-posting, which necessitates maximizing the use of existing data to synthesize new data. However, it is a challenge due to the intrinsic motion stochasticity of human motion dynamics, manifested in the short and long terms. In the short term, there is strong randomness within a couple frames, e.g. one frame followed by multiple possible frames leading to different motion styles; while in the long term, there are non-deterministic action transitions. In this paper, we present Dynamic Future Net, a new deep learning model where we explicitly focuses on the aforementioned motion stochasticity by constructing a generative model with non-trivial modelling capacity in temporal stochasticity. Given limited amounts of data, our model can generate a large number of high-quality motions with arbitrary duration, and visually-convincing variations in both space and time. We evaluate our model on a wide range of motions and compare it with the state-of-the-art methods. Both qualitative and quantitative results show the superiority of our method, for its robustness, versatility and high-quality.

연구 동기 및 목표

  • 제한된 훈련 데이터에서 다양하고 고품질의 인간 운동 시퀀스를 생성하는 데 도전하는 것.
  • 인간 운동 역학에서 단기(프레임 수준) 및 장기(행동 수준)의 확률적 특성을 명시적으로 모델링하는 것.
  • 생성 모델이 높은 다양성을 유지하면서도 운동 품질을 유지할 수 있도록 하는 것.
  • 재학습 없이 혼합 또는 단일 운동 유형에서 훈련 가능하게 하여 유연성을 높이는 것.
  • 점 추정 기반 손실을 분포 유사성 손실로 대체하여 운동의 무작위성 모델링을 향상시키는 것.

제안 방법

  • DFN은 운동 시퀀스를 저차원 잠재 공간에 매핑하기 위해 변동형 오토인코더를 사용하여 효율적인 역학 모델링을 가능하게 한다.
  • 양방향 순환 신경망을 사용하여 과거 및 미래 상태를 동시에 모델링하여 단기적인 자세 전이와 장기적인 행동 변화를 모두 포착한다.
  • 현재 상태를 이전 및 미래의 맥락에 명시적으로 조건화함으로써 확률적 전이의 동적 모델링을 가능하게 한다.
  • 예측된 자세 분포와 진짜 자세 분포를 비교하는 새로운 분포 기반 손실 함수를 도입하여 다양성을 향상시킨다.
  • 혼합된 운동 유형에서의 엔드 투 엔드 훈련을 지원하여 다양한 데이터에서 다중 모달 역학 학습이 가능하다.
  • 추론 과정에서는 잠재 코드와 미래 맥락에 기반한 조건부 샘플링 전략을 사용하여 임의의 길이의 운동 생성이 가능하다.

실험 결과

연구 질문

  • RQ1딥 생성 모델이 인간 운동 역학에서 단기 및 장기 확률적 특성을 효과적으로 포착할 수 있는가?
  • RQ2최소한의 데이터(예: 15초 미만)로 훈련된 모델이 다양하고 고품질의 운동 시퀀스를 얼마나 잘 생성할 수 있는가?
  • RQ3재학습 없이도 여러 운동 유형(예: 걷기, 달리기, 막판)을 통합해 일반화할 수 있는가?
  • RQ4미래 맥락을 모델링함으로써 자동재귀적 또는 단방향 모델 대비 운동의 다양성과 시간적 일관성이 향상되는가?
  • RQ5분포 기반 손실 함수가 표준 점 추정 복원 손실 대비 운동 다양성 향상에 얼마나 기여하는가?

주요 결과

  • DFN은 최소 7초의 운동 데이터로도 다양하고 시각적으로 신뢰할 수 있는 시퀀스를 생성하며, 지속 시간이 임의로 설정된 운동을 생성할 수 있다.
  • 생성된 운동은 높은 품질과 시간적 일관성을 유지하며, 자연스러운 자세 변화와 타당한 행동 전이를 보인다.
  • 혼합된 운동 유형으로 훈련된 DFN은 다중 모달 역학을 포착하고, 한 번의 프리픽스로도 걷기에서 달리기 또는 춤추기 등 다양한 운동 스타일을 생성할 수 있다.
  • 분포 기반 손실 함수는 점 추정 복원 손실 대비 유의미하게 더 높은 다양성을 보이며, 훈련 데이터와의 평균 거리 분포 일치도를 통해 검증되었다.
  • 생성된 운동은 자세 분포에서 훈련 데이터와 강한 통계적 유사성을 보이며, 시간 단위별 평균 거리 분포가 실제 데이터와 밀접하게 일치한다.
  • 훈련 데이터가 극적으로 감소했음에도 불구하고(최소 7초), DFN은 안정적이고 타당한 운동 생성을 유지하여 데이터 부족에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.