Skip to main content
QUICK REVIEW

[論文レビュー] NeMF: Neural Motion Fields for Kinematic Animation

Chengan He, Jun Saito|arXiv (Cornell University)|Jun 4, 2022
Human Motion and Animation被引用数 12
ひとこと要約

NeMFは、時間とスタイルを変数とする微分可能関数として運動をモデル化することで、連続的で暗黙的な神経表現を用いて運動のキネマティック表現を導入した。VAEベースのアーキテクチャを用いて生成的運動事前分布を学習し、タスク固有の微調整なしに高品質で多様な運動合成と編集(補間、中間フレーム生成、再ナビゲーションなど)を可能にする。

ABSTRACT

We present an implicit neural representation to learn the spatio-temporal space of kinematic motions. Unlike previous work that represents motion as discrete sequential samples, we propose to express the vast motion space as a continuous function over time, hence the name Neural Motion Fields (NeMF). Specifically, we use a neural network to learn this function for miscellaneous sets of motions, which is designed to be a generative model conditioned on a temporal coordinate $t$ and a random vector $z$ for controlling the style. The model is then trained as a Variational Autoencoder (VAE) with motion encoders to sample the latent space. We train our model with a diverse human motion dataset and quadruped dataset to prove its versatility, and finally deploy it as a generic motion prior to solve task-agnostic problems and show its superiority in different motion generation and editing applications, such as motion interpolation, in-betweening, and re-navigating. More details can be found on our project page: https://cs.yale.edu/homes/che/projects/nemf/.

研究の動機と目的

  • 逐次的依存性により、将来のフレームや中間フレームを直接推論できない自己回帰的運動モデルの限界を解消すること。
  • 時間とスタイルをパラメータとする連続的で暗黙的な神経表現を構築し、任意のフレームをサンプリング可能にする。
  • 大規模な運動データセットから多様な運動スタイルを捉えるために、変分自己オートエンコーダー(VAE)を用いて生成的運動事前分布を学習すること。
  • 学習された運動事前分布の有効性を、補間、中間フレーム生成、再ナビゲーションといったタスクに依存しない運動編集・生成タスクで示すこと。
  • 再トレーニングなしにオフライン編集アプリケーションでタスク特化モデルを上回る汎用的かつ再利用可能な運動事前分布を確立すること。

提案手法

  • 時間tと学習済みの潜在的スタイルコードzを変数とする連続関数f(t; z)として運動を表現する。MLPデコーダーを用いる。
  • モデルを変分自己オートエンコーダー(VAE)として訓練する。運動シーケンスは畳み込みエンコーダーにより潜在ベクトルzに符号化され、その後元の運動シーケンスを再構築する。
  • 時間座標tと潜在的スタイルベクトルzの両方に条件付けられた生成モデルを設計し、任意の時間ステップで多様な運動スタイルをサンプリング可能にする。
  • 予測された運動シーケンスと真値の間の再構成損失を最適化することで、人間および四足歩行の運動データセット上でエンドツーエンドの訓練を可能にする。
  • 下流タスク用に訓練済みNeMFを運動事前分布として展開する際は、目的の運動シーケンスを生成するためにzに関する最適化問題を解く。
  • 補間、中間フレーム生成、再ナビゲーションなどの運動編集タスクを、潜在的コードの最適化問題として定式化し、妥当な運動を回復するためのエネルギー関数を最小化する。

実験結果

リサーチクエスチョン

  • RQ1離散的で自己回帰的なアプローチに比べ、連続的で暗黙的な神経表現は、運動の全時空間的・空間的領域をより効果的にモデル化できるか?
  • RQ2VAEベースのアーキテクチャは、異なるスタイルや時間点において多様で高精細な運動生成を可能にする分離された運動事前分布を学習できるか?
  • RQ3NeMFから得られる単一のタスクに依存しない運動事前分布は、補間や中間フレーム生成といった運動編集タスクで、タスク特化モデルを上回る性能を示せるか?
  • RQ4NeMFは、未知の運動スタイルや、新しい経路に沿った再ナビゲーションのような複雑な編集シナリオにどの程度一般化できるか?
  • RQ5スパarsなキーフレーム補間において、NeMFはHM-VAE や SLERP といった既存の運動事前分布と比較して、定量的・定性的にどの程度優れているか?

主な発見

  • NeMFは、人間および四足歩行の運動データセットにおいて、最新の神経運動事前分布(HM-VAEなど)を上回る運動の質と多様性を達成した。
  • 20フレーム間隔のスパースキーフレーム補間において、NeMFはFIDスコアでSLERP や HM-VAE を上回り、より自然で高周波数の運動ディテールを生成した。
  • 運動補間において、NeMFは滑らかで現実的と思われる運動クリップ間の遷移を生成し、時間的整合性が向上したと定性的に示された。
  • 運動再ナビゲーションにおいて、NeMFは参照となる歩行運動を直線的およびサイン波状の経路に沿って再ナビゲートし、元の運動スタイルと自然な姿勢を維持した。
  • NeMFは、実際のAIST++ダンスクリップ間で1秒の遷移を妥当に生成でき、実世界の運動データへの強い一般化能力を示した。
  • タスク特化モデルと同等またはそれ以上の性能を示したが、これはタスクに依存しない方法で学習されたにもかかわらずである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。