[論文レビュー] Human Action Generation with Generative Adversarial Networks
本論文では、行動クラスラベルと初期ポーズを条件として、多様で連続する人間の行動シーケンスを生成するための条件付き GAN-オートエナボーダーフレームワークを提案する。エンド・トゥ・エンドで統合的に訓練されたオートエナボーダーと条件付き GAN を併用することで、モデルは新たなスタイルバリエーションを有する行動を生成可能である—NTU RGB+D データセットを用いて実証済み—、事前の運動シーケンスを必要とせず、複数の行動間を滑らかに遷移させることが可能である。
Inspired by the recent advances in generative models, we introduce a human action generation model in order to generate a consecutive sequence of human motions to formulate novel actions. We propose a framework of an autoencoder and a generative adversarial network (GAN) to produce multiple and consecutive human actions conditioned on the initial state and the given class label. The proposed model is trained in an end-to-end fashion, where the autoencoder is jointly trained with the GAN. The model is trained on the NTU RGB+D dataset and we show that the proposed model can generate different styles of actions. Moreover, the model can successfully generate a sequence of novel actions given different action labels as conditions. The conventional human action prediction and generation models lack those features, which are essential for practical applications.
研究の動機と目的
- 既存の行動予測モデルには制御性に欠如しているという問題に対処する。具体的には、望ましい行動クラスラベルや初期状態に基づいて新たな行動を生成できない点である。
- RNNベースや GAN ベースの先行モデルに見られる制限を克服し、滑らかな遷移を実現する複数の連続した人間の行動シーケンスの生成を可能にする。
- ランダムノイズベクトル $ z $ を用いたスタイル制御を実現し、同じ行動クラス内でも多様な動きのスタイルを生成可能にする。
- 入力運動シーケンスを必要とせず、行動クラスラベル $ l $ と初期ポーズ $ c $ のみに依存して、新たな行動シーケンスを生成する可能性を実証する。
提案手法
- 変分オートエナボーダー(VAE)と条件付き生成対抗ネットワーク(cGAN)を組み合わせ、エンド・トゥ・エンドで統合的に訓練する。
- 生成器は、ランダムノイズベクトル $ z $、行動クラスラベル $ l $、初期ポーズ $ c $ を入力とし、スケルトンポーズのシーケンスを出力する。
- 識別器は、$ l $ と $ c $ を条件として、実際のシーケンスと生成されたシーケンスを区別することで、生成された行動シーケンスの現実性を評価する。
- オートエナボーダー部は、人間の運動シーケンスのコンactな潜在表現を学習し、これにより GAN の訓練を補助する。
- 各行動生成後に最終ポーズと新しい行動ラベルを用いて $ c $ と $ l $ を再初期化することで、逐次的生成を実現する。
- Microsoft Kinect からのスケルトンシーケンスを用いて NTU RGB+D データセット上で訓練を実施し、生成器は対抗損失と再構成損失の両方で訓練される。
実験結果
リサーチクエスチョン
- RQ1生成モデルは、事前の運動シーケンスに依存せずに、多様で新規の行動シーケンスを生成できるか?
- RQ2異なる行動クラス間で滑らかな遷移を実現する連続した行動シーケンスを生成できるか?
- RQ3ランダムノイズベクトル $ z $ は、同じ行動クラス内での動きのスタイルをどの程度制御できるか?
- RQ4初期ポーズと行動クラスラベルの両方を条件として、モデルはどの程度効果的に行動を生成できるか?
主な発見
- 図 3 に示すように、ランダムノイズベクトル $ z $ を変化させることで、同じ行動クラスに対して多様で異なるスタイルの行動シーケンスをモデルが成功して生成した。
- 図 5 と 6 に示すように、座る動作の後に立ち上がる動作といった、連続する行動シーケンスを滑らかな遷移で生成した。
- 図 7 に示すように、異なる初期ポーズ $ c $ が生成シーケンスの異なる開始位置をもたらし、モデルの初期条件への感受性が確認された。
- 入力運動シーケンスを必要とせず、行動クラスラベル $ l $ と初期ポーズ $ c $ のみに依存して、現実的で多様な運動シーケンスを生成した。
- RNN や複数の GAN を必要とせず、行動クラスと初期状態の両方を制御可能な点で、先行モデル(例:HP-GAN)を上回る性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。