Skip to main content
QUICK REVIEW

[논문 리뷰] NeMF: Neural Motion Fields for Kinematic Animation

Chengan He, Jun Saito|arXiv (Cornell University)|2022. 06. 04.
Human Motion and Animation인용 수 12
한 줄 요약

NeMF는 시간과 스타일에 대한 미분 가능 함수로 운동을 모델링함으로써 운동의 연속적이고 암묵적인 신경 표현을 도입한다. VAE 기반 아키텍처를 사용해 생성적 운동 사전을 학습한다. 이는 태스크별 미세조정 없이도 고품질이고 다양한 운동 합성 및 편집(예: 보간, 중간 프레임 생성, 재내비게이션)을 가능하게 한다.

ABSTRACT

We present an implicit neural representation to learn the spatio-temporal space of kinematic motions. Unlike previous work that represents motion as discrete sequential samples, we propose to express the vast motion space as a continuous function over time, hence the name Neural Motion Fields (NeMF). Specifically, we use a neural network to learn this function for miscellaneous sets of motions, which is designed to be a generative model conditioned on a temporal coordinate $t$ and a random vector $z$ for controlling the style. The model is then trained as a Variational Autoencoder (VAE) with motion encoders to sample the latent space. We train our model with a diverse human motion dataset and quadruped dataset to prove its versatility, and finally deploy it as a generic motion prior to solve task-agnostic problems and show its superiority in different motion generation and editing applications, such as motion interpolation, in-betweening, and re-navigating. More details can be found on our project page: https://cs.yale.edu/homes/che/projects/nemf/.

연구 동기 및 목표

  • 자기연쇄적 운동 모델이 순차적 의존성으로 인해 미래나 중간 프레임을 직접 추론할 수 없는 한계를 해결하기 위해.
  • 시간과 스타일을 변수로 하는 연속적이고 암묵적인 신경 표현을 개발하여 임의의 프레임 샘플링을 가능하게 하기 위해.
  • 대규모 운동 데이터셋에서 다양한 운동 스타일을 포괄하는 생성적 운동 사전을 학습하기 위해 변동형 자동에코더(Variational Autoencoder, VAE)를 사용하기 위해.
  • 학습된 운동 사전이 태스크에 종속되지 않는 운동 편집 및 생성 작업(예: 보간, 중간 프레임 생성, 재내비게이션)에서의 유용성을 입증하기 위해.
  • 재학습 없이도 오프라인 편집 응용에서 태스크별 모델보다 뛰어난 성능을 보이는 일반적이고 재사용 가능한 운동 사전을 확립하기 위해.

제안 방법

  • 시간 t와 학습된 잠재 스타일 코드 z에 대한 연속 함수 f(t; z)로 운동을 표현함으로써, 다층 퍼셉트론(MLP) 디코더를 사용한다.
  • 모델을 변동형 자동에코더(VAE)로 학습함: 운동 시퀀스는 컨volutional 인코더를 통해 잠재 벡터 z로 인코딩되고, 다시 원래의 전체 운동 시퀀스로 디코딩된다.
  • 시간 좌표 t와 잠재 스타일 벡터 z에 조건을 주어, 임의의 시간 단계에서 다양한 운동 스타일의 샘플링을 가능하게 한다.
  • 예측된 운동 시퀀스와 진짜 운동 시퀀스 간의 복원 손실을 최적화하여, 인간 및 4족 운동 데이터셋에서 엔드 투 엔드 학습이 가능하도록 한다.
  • 학습된 NeMF를 타깃 운동 시퀀스를 생성하기 위해 잠재 공간 z에 대한 최적화 문제를 해결함으로써, 후속 작업용 운동 사전로 활용한다.
  • 보간, 중간 프레임 생성, 재내비게이션 등의 운동 편집 작업을 잠재 코드 최적화 문제로 공식화하고, 에너지 함수를 최소화하여 자연스러운 운동을 복원한다.

실험 결과

연구 질문

  • RQ1연속적이고 암묵적인 신경 표현이 이산적이고 자기연쇄적인 접근 방식보다 운동의 전체 시공간 공간을 더 효과적으로 모델링할 수 있는가?
  • RQ2VAE 기반 아키텍처가 다양한 스타일과 시간점에서 다양하고 고해상도의 운동 생성을 가능하게 하는 분리된 운동 사전을 학습할 수 있는가?
  • RQ3NeMF에서 파생된 단일한 태스크에 종속되지 않는 운동 사전이 보간 및 중간 프레임 생성과 같은 운동 편집 작업에서 태스크별 모델보다 뛰어난 성능을 보일 수 있는가?
  • RQ4NeMF는 새로운 경로를 따라 운동을 재내비게이션하는 것과 같은 복잡한 편집 시나리오나 새로운 운동 스타일에 얼마나 잘 일반화될 수 있는가?
  • RQ5NeMF는 희박한 关键 프레임 보간에서 기존의 운동 사전인 HM-VAE와 SLERP와 비교해 정량적·정성적으로 어떻게 성능을 내는가?

주요 결과

  • NeMF는 인간 및 4족 운동 데이터셋에서 최신의 신경 운동 사전(HM-VAE 포함)보다 뛰어난 운동 품질과 다양성을 달성한다.
  • 20프레임 간격의 희박한 관键 프레임 보간에서, NeMF는 FID 점수에서 SLERP와 HM-VAE를 모두 능가하며 더 자연스럽고 고주파 운동 세부 정보를 생성한다.
  • 운동 보간 작업에서는 NeMF가 운동 클립 간에 부드럽고 자연스러운 전이를 생성하며, 정성적 결과로 시간적 일관성이 향상됨을 보여준다.
  • 운동 재내비게이션 작업에서는 NeMF가 기준 걷기 운동을 직선 및 사인파 경로로 성공적으로 재내비게이션하면서 원본 운동 스타일과 자연스러운 방향성을 유지한다.
  • NeMF는 실제 AIST++ 댄스 클립 간에 1초 분량의 자연스러운 전이를 생성하여 실제 운동 데이터에 대한 강력한 일반화 능력을 입증한다.
  • NeMF는 태스크에 종속되지 않는 방식으로 학습되었음에도 불구하고, 편집 작업에서 태스크별 모델과 비슷하거나 더 뛰어난 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.