Skip to main content
QUICK REVIEW

[論文レビュー] Pose Guided Human Video Generation

Ceyuan Yang, Zhe Wang|ArXiv.org|Jul 30, 2018
Generative Adversarial Networks and Image Synthesis参考文献 31被引用数 10
ひとこと要約

本稿では、行動ラベルに条件づけられた現実的なポーズ系列を予測するポーズシーケンスGAN(PSGAN)を用いて、2段階のポーズガイドドフレームワークを提案する。その後、予測されたポーズから高精細な動画フレームを生成するセマンティック一貫性GAN(SCGAN)を用い、ノイズの影響を受ける状況でも高レベルの意味的整合性を保つように設計されている。本手法は、人間の行動および顔の表情データセットにおいて、動画のリアリズムと動きの制御性の両面で最先端の性能を達成している。

ABSTRACT

Due to the emergence of Generative Adversarial Networks, video synthesis has witnessed exceptional breakthroughs. However, existing methods lack a proper representation to explicitly control the dynamics in videos. Human pose, on the other hand, can represent motion patterns intrinsically and interpretably, and impose the geometric constraints regardless of appearance. In this paper, we propose a pose guided method to synthesize human videos in a disentangled way: plausible motion prediction and coherent appearance generation. In the first stage, a Pose Sequence Generative Adversarial Network (PSGAN) learns in an adversarial manner to yield pose sequences conditioned on the class label. In the second stage, a Semantic Consistent Generative Adversarial Network (SCGAN) generates video frames from the poses while preserving coherent appearances in the input image. By enforcing semantic consistency between the generated and ground-truth poses at a high feature level, our SCGAN is robust to noisy or abnormal poses. Extensive experiments on both human action and human face datasets manifest the superiority of the proposed method over other state-of-the-arts.

研究の動機と目的

  • 既存の動画生成手法における明示的な動き制御の欠如、特に人間の動きに関しての課題を解決すること。
  • 人間の動きダイナミクスと外見を分離することで、制御性とリアリズムの向上を図ること。
  • ノイズや異常なポーズ入力に対しても安定した動画生成フレームワークを構築すること。
  • 生成された動画における人間のポーズと外見の明示的な操作を可能にすること。
  • 1枚の入力画像とポーズのシーケンスのみを用いて高精細な動画合成を達成すること。

提案手法

  • 行動クラスラベルに条件づけられた時間的に整合性のあるポーズ系列を生成するポーズシーケンス生成的対抗ネットワーク(PSGAN)を訓練する。
  • 予測されたポーズ系列と入力画像から動画フレームを生成するセマンティック一貫性生成的対抗ネットワーク(SCGAN)を用い、高レベルの特徴表現における生成済みポーズと真値ポーズの意味的整合性を強制する損失関数を導入する。
  • SCGANは特徴レベルの一貫性損失を用いて訓練を安定化させ、推論時におけるノイズや異常なポーズへの耐性を向上させる。
  • フレームワークは、動き(ポーズ系列)と外見(画像)の生成を分離することで、ポーズとアイデンティティの独立した制御を可能にする。
  • 推論時には、生成されたポーズ系列のみが使用されるが、意味的整合性損失は訓練時に真値ポーズを用いて適用される。
  • 本手法は、人間の行動および顔の表情データセットの両方で訓練および評価され、Inceptionスコア、SSIM、LPIPS、およびユーザースタディを含む定量的指標が用いられている。

実験結果

リサーチクエスチョン

  • RQ1ポーズダイナミクスと外見モデリングを分離する分離型の動画生成フレームワークは、より高いリアリズムと制御性を達成できるか?
  • RQ2生成済みポーズと真値ポーズの意味的整合性は、ノイズや異常なポーズ系列に対して効果的に耐性を高めるか?
  • RQ3入力ポーズが不完全であっても、明示的なポーズおよび外見の制御が可能な高精細な動画を生成できるか?
  • RQ4視覚的品質および定量的指標の観点から、最先端の手法と比較して本手法の性能はどの程度優れているか?
  • RQ5本モデルは、異なるアイデンティティや行動タイプにわたって一般化可能であり、時間的整合性を維持できるか?

主な発見

  • 提案手法は、人間の行動データセットでInceptionスコア(IS)8.92、顔の表情データセットで9.15を達成し、先行手法を上回った。
  • 意味的整合性損失を備えたSCGANモデルは、人間の行動データセットで構造的類似性(SSIM)0.87、LPIPS 0.041を達成し、SCGAN-genベースライン(SSIM: 0.73、LPIPS: 0.083)を上回った。
  • ユーザースタディでは、MoCoGANとの対比で72%、VGANとの対比で78%のペア比較で本手法がよりリアリストイと選ばれた。
  • 制御された生成実験では、同じ人物に対して異なる行動を合成可能であり、また、異なるアイデンティティ間で同じ行動を再現可能であった。これにより、分離性と一般化性能が裏付けられた。
  • アブレーションスタディにより、意味的整合性損失が、特に顔や身体領域の詳細におけるノイズ低減効果をもたらし、動画品質の向上に顕著に寄与することが確認された。
  • 静的ベースライン(最初のフレームを繰り返す)と比較して、本手法は全指標で優れた性能を示し、単なるフレーム繰り返しを超えた有効な動き生成が実現されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。