Skip to main content
QUICK REVIEW

[論文レビュー] Generative Models for Pose Transfer

Patrick Chao, Alexander Li|arXiv (Cornell University)|Jun 24, 2018
Human Pose and Action Recognition参考文献 2被引用数 3
ひとこと要約

本稿では、k-Nearest Neighbors (k-NN) と条件付き生成モデル (pix2pix) を用いたポーズ転送パイプラインを提案し、動画内で一人の人物の行動を別の人物に転送する。pix2pixモデルは、滑らかでアーチファクトのない、シャープな動画を生成する点でk-NNを上回り、トレーニング時のポーズ分布を超えた一般化性能を示している。

ABSTRACT

We investigate nearest neighbor and generative models for transferring pose between persons. We take in a video of one person performing a sequence of actions and attempt to generate a video of another person performing the same actions. Our generative model (pix2pix) outperforms k-NN at both generating corresponding frames and generalizing outside the demonstrated action set. Our most salient contribution is determining a pipeline (pose detection, face detection, k-NN based pairing) that is effective at perform-ing the desired task. We also detail several iterative improvements and failure modes.

研究の動機と目的

  • 動画形式で、一人の人物から別の人物への人間のポーズシーケンスを転送するための堅牢なパイプラインの開発。
  • k-NNと条件付きGAN(pix2pix)が、高品質で時間的に一貫性のある動画フレームを生成する効果性の評価。
  • ノイズの多いポーズ推定や特定のボディーラインに過適合するなどの失敗モードの同定と是正。
  • 特にトレーニングデータに存在しない未観測のポーズへの一般化を向上させる手法の探求。
  • 計算遅延の低減と、リアルタイムまたはニアリアルタイムのポーズ転送の実現

提案手法

  • 入力動画フレームから18関節2次元ポーズスケルトンをOpenPoseで抽出し、隠蔽された関節には中央値補完を適用。
  • 関節座標空間におけるL2距離を用いたk-NNを用い、ソースとターゲット個体間のポーズをマッチング。
  • 条件付きGAN(pix2pix)を用いて、ポーズスケルトンを直接リアルな画像フレームにマッピングし、中間表現を回避。
  • 過適合と一般化性能の低下を防ぐために、監視信号としてのエッジ検出を当初導入したが、最終的に除外。
  • 顔の輪郭を補完するため、dlib顔検出器を用い、顔の生成品質を向上。
  • 時間的一致性の向上を図るため、フレームごとの生成を検討。将来、カルマンフィルターや圧縮モデルの利用を想定。

実験結果

リサーチクエスチョン

  • RQ1k-NNに基づくポーズマッチングは、体型や衣服が異なる人物間で、行動を効果的に転送できるか?
  • RQ2条件付きGAN(pix2pix)の性能は、k-NNに比べ、リアルでシャープでアーチファクトのない動画フレームを生成する点で優れているか?
  • RQ3生成モデルは、トレーニング時に見られなかったポーズに対しても、どの程度一般化できるか?
  • RQ4ノイズの多いポーズ推定は、k-NNおよびGANベースのポーズ転送の性能にどのように影響するか?
  • RQ5位置空間ではなく関節角度空間で作業することで、身長の異なる個体間でのk-NNマッチングのロバスト性は向上するか?

主な発見

  • pix2pix条件付きGANは、アーチファクトを最小限に抑え、滑らかでリアルな動画フレームを生成する点でk-NNを上回った。
  • pix2pixモデルは、トレーニングデータに存在しなかったポーズ、例えば両手を頭上に挙げるようなポーズに対しても、成功裏に一般化した。
  • k-NNの性能は、ノイズの多いポーズスケルトンによって著しく損なわれ、ジャンプするような遷移やフレームマッチングの悪化を引き起こした。
  • エッジ検出は監視信号として意図されたが、過適合を引き起こし、最終的にパイプラインから除外された。
  • 関節位置空間ではなく関節角度空間を用いることで、身体的属性が異なる個体間でのk-NNマッチングのロバスト性が向上する可能性がある。
  • 現在のパイプラインでは1フレームあたり約1秒の生成時間であり、60 FPSのリアルタイムに遠く及ばないため、最適化の必要がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。