Skip to main content
QUICK REVIEW

[論文レビュー] Vid2Game: Controllable Characters Extracted from Real-World Videos

Oran Gafni, Lior Wolf|arXiv (Cornell University)|Apr 17, 2019
Human Pose and Action Recognition参考文献 38被引用数 10
ひとこと要約

本稿では、2次元の制御信号(例:ジョイスティック入力)を用いて、現実世界の動画から制御可能で写真のようにリアルなキャラクターを抽出し、再アニメーション化する Vid2Game という手法を提案する。2つの新規ディープニューラルネットワーク—自己回帰的ポーズ生成のための Pose2Pose(P2P)と、任意の背景置換えを伴う高精細な画像合成のための Pose2Frame(P2F)—を用い、正確な動きと外見のモデリングを実現した、アーティファクトのないリアルな動画シーケンスを生成する。

ABSTRACT

We are given a video of a person performing a certain activity, from which we extract a controllable model. The model generates novel image sequences of that person, according to arbitrary user-defined control signals, typically marking the displacement of the moving body. The generated video can have an arbitrary background, and effectively capture both the dynamics and appearance of the person. The method is based on two networks. The first network maps a current pose, and a single-instance control signal to the next pose. The second network maps the current pose, the new pose, and a given background, to an output frame. Both networks include multiple novelties that enable high-quality performance. This is demonstrated on multiple characters extracted from various videos of dancers and athletes.

研究の動機と目的

  • 制御不能な現実世界の動画から、制御可能で写真のようにリアルな人間のキャラクターを抽出し、動的な仮想環境で利用可能にする。
  • ユーザー定義の 2次元制御信号(例:ジョイスティックの軌道)に従って、抽出されたキャラクターが動く長時間で一貫性のある動画シーケンスを生成する。
  • 元の背景を、動的である可能性のある任意のユーザー指定の背景にシームレスに置き換えつつ、リアルなブレンドと影の再現を維持する。
  • 背景分離、トレーニング分布外のポーズへの一般化、自己回帰的生成における時間的ずれといった課題に対処する。

提案手法

  • 2次元制御信号(例:重心の軌道)と現在のポーズを条件として、自己回帰的に全身ポーズのシーケンスを生成する Pose2Pose(P2P)ネットワークを用いる。
  • 生成されたポーズ、背景画像、前面マスクから、高解像度で写真のようにリアルな動画フレームを合成する Pose2Frame(P2F)ネットワークを採用する。
  • 両ネットワークのバックボーンとして pix2pixHD フレームワークを採用するが、新たに導入した要素を追加する:ポーズ制御の向上のための条件付けブロック、持ち物のためのオブジェクトチャネル統合、および特徴マッチングに基づく識別器損失。
  • 一貫性のある2次元ボディポーズ表現とセマンティックセグメンテーションを用いて、手に持つ物体を抽出し、正確な外見モデリングを実現する。
  • 推論時に「教師強制(teacher forcing)」を適用し、ポーズ予測の安定化と時間的ずれの低減を図る。
  • 予測されたマスクと影ブレンドを活用した背景置換えパイプラインを導入し、アーティファクトのないリアルな合成を実現する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、低次元の2次元制御信号のみを用いて、制御可能で写真のようにリアルなキャラクターを制御不能な動画から抽出し、再アニメーション化できるか?
  • RQ2モデルは、任意の背景置換えを伴いながらも、運動ダイナミクスと外見忠実度を保持したリアルな動画シーケンスを生成できるか?
  • RQ3本モデルは、トレーニング分布外の新しいポーズや制御信号に対して、どの程度一般化できるか?
  • RQ4本手法は、既存のビデオtoビデオ変換モデルと比較して、画像品質、背景処理、時間的整合性の観点でどの程度優れているか?

主な発見

  • Pose2Frame ネットワークは、pix2pixHD や vid2vid といったベースライン手法と比較して優れた知覚的品質を達成し、LPIPS スコアが低く(例:テニステストセットで 0.28 対 0.35)、SSIM 値が高かった。
  • P2F ネットワークは、動的背景を伴う複雑なシーンにおいても、背景アーティファクトやキャラクターの歪みを顕著に低減し、シーン全体をモデル化する手法を上回った。
  • アブレーションスタディにより、提案された条件付けブロックとオブジェクトチャネル統合がポーズ生成品質を向上させ、従来のベースラインと比較して LPIPS を 12% 減少させた。
  • 本手法は、キャラクターの比率を一貫して維持し、ドライビングポーズに沿った歪みを回避するが、vid2vid ベースラインは顕著なスケーリングや歪みを示した。
  • 時間的滑らかさの損失を用いていないにもかかわらず、生成された動画は最先端の手法と同等に時間的に滑らかであり、内部の運動モデリングの強さを示している。
  • 本システムは、非常に動的または複雑な背景でさえも、リアルな影のブレンドと運動エフェクトを維持したまま、長時間で一貫性のある動画シーケンスを効果的に生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。