Skip to main content
QUICK REVIEW

[論文レビュー] Combining Recurrent Neural Networks and Adversarial Training for Human Motion Synthesis and Control

Zhiyong Wang, Jinxiang Chai|arXiv (Cornell University)|Jun 21, 2018
Human Motion and Animation被引用数 10
ひとこと要約

この論文では、LSTMに基づくRNNと敵対的訓練を組み合わせた接触に配慮した生成モデルを提案している。このモデルは、GANに類似した識別ネットワークを用いてRNNが生成する動きを精錬し、接触情報を統合することで、無限長で高精細な動きを生成し、実際のモーショングラフデータと区別がつかないほどのリアルさを実現する。ベースラインRNNよりもリアルさと制御応用において優れている。

ABSTRACT

This paper introduces a new generative deep learning network for human motion synthesis and control. Our key idea is to combine recurrent neural networks (RNNs) and adversarial training for human motion modeling. We first describe an efficient method for training a RNNs model from prerecorded motion data. We implement recurrent neural networks with long short-term memory (LSTM) cells because they are capable of handling nonlinear dynamics and long term temporal dependencies present in human motions. Next, we train a refiner network using an adversarial loss, similar to Generative Adversarial Networks (GANs), such that the refined motion sequences are indistinguishable from real motion capture data using a discriminative network. We embed contact information into the generative deep learning model to further improve the performance of our generative model. The resulting model is appealing to motion synthesis and control because it is compact, contact-aware, and can generate an infinite number of naturally looking motions with infinite lengths. Our experiments show that motions generated by our deep learning model are always highly realistic and comparable to high-quality motion capture data. We demonstrate the power and effectiveness of our models by exploring a variety of applications, ranging from random motion synthesis, online/offline motion control, and motion filtering. We show the superiority of our generative model by comparison against baseline models.

研究の動機と目的

  • 深層学習を用いて人間の動きにおける非線形ダイナミクスと長期的な時系列依存性をモデル化する課題に取り組む。
  • RNNに基づく動き生成と敵対的訓練を統合することで、動きのリアルさを向上させる。
  • 接触情報を生成モデルに組み込むことで、物理的に妥当で視覚的アーチファクトの少ない動きの質を向上させる。
  • 多様な動きタイプに一般化可能なコンactでスケーラブルなモデルを用いて、柔軟な動きの制御と合成を可能にする。
  • 元の学習データを保存せずに、リアルタイムで高品質な動き生成とフィルタリングが可能なシステムを開発する。

提案手法

  • 時系列的な動きのダイナミクスをモデル化し、長期的な依存関係を捉えるために、長短期記憶(LSTM)ネットワークを生成器として使用する。
  • 生成された動きが実際のモーショングラフデータと区別がつかないよう、敵対的損失を用いて訓練されるリファインメントネットワーク(R)を採用する。
  • 動きのシーケンスを「実際のもの」または「リファインメント済みのもの」と分類する識別ネットワーク(D)を導入し、生成器とミニマックスゲームを形成する。
  • 地面との接触(例:足の接触)などの接触状態情報を入力特徴として組み込むことで、物理的妥当性を高め、アーチファクトを低減する。
  • 元のRNN出力とリファインメント済みの動きとの間の構造的類似性を保つために自己正則化損失を適用する。
  • 敵対的損失(識別器を欺くため)と再構成損失(動きの忠実度を維持するため)を組み合わせた損失関数を用いて、エンド・ツー・エンドで全システムを訓練する。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練は、RNNが生成する人間の動きのシーケンスのリアルさを顕著に向上させることができるか?
  • RQ2接触情報を統合することで、合成された動きの質と物理的妥当性はどのように変化するか?
  • RQ3提案されたモデルは、制御やアニメーションに適した無限長で多様かつ高精細な動きのシーケンスを生成できるか?
  • RQ4ユーザーが定義した制約下で、ベースラインRNNと比較して、動きのリアルさと一般化性能はどのように差がつくか?
  • RQ5再訓練から始めずに、新しいデータでモデルをファインチューニングできる範囲はどの程度か?

主な発見

  • 提案モデル(GAN2)は、歩行シーケンスで平均ユーザーレーティング4.75、走行で4.68を達成し、実際のモーショングラフデータ(Mocap)の品質に近く、ほぼ同等のリアルさを実現した。
  • ベースラインRNNおよびGANオンリーバリエーション(GAN1)よりも優れた性能を示し、接触に配慮したモデリングの利点を実証した。
  • モデルが生成する動きのシーケンスは、常にリアルで自然な印象を受けることができ、足のスライディングや不安定さなどの視覚的アーチファクトが最小限に抑えられた。
  • GTX 970 GPU上で30 FPSのリアルタイム推論が達成され、インタラクティブなアプリケーションへの実用的応用が可能になった。
  • モデルはコンactでスケーラブルなままであり、追加の学習データに応じてサイズが増大しない。また、再訓練から始めずにファインチューニングが可能である。
  • MAPに基づく動き制御フレームワークは、ユーザーの制約と動きの事前分布の両方をうまくバランスさせ、入力制約がノイズが多いか不自然であっても、自然な動きを生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。