Skip to main content
QUICK REVIEW

[論文レビュー] Human Motion Transfer from Poses in the Wild

Jian Ren, Menglei Chai|arXiv (Cornell University)|Apr 7, 2020
Human Pose and Action Recognition参考文献 55被引用数 10
ひとこと要約

本稿では、未収録のポーズや困難なポーズに対しても、高精細で時間的に整合性があり、写真のようなリアルな結果を達成する、高忠実な人間の動き移行を実現する2段階のポーズから動画への変換フレームワークを提案する。統一されたペairedおよびunpaired学習、ポーズ増強、およびリファインメントネットワークを用いることで、信頼性が高く、時間的に整合性のある結果を実現する。複数のデータセットにおいてSOTAを著しく上回り、FID(5.9453)およびSSIM(0.9666)の向上を達成した。

ABSTRACT

In this paper, we tackle the problem of human motion transfer, where we synthesize novel motion video for a target person that imitates the movement from a reference video. It is a video-to-video translation task in which the estimated poses are used to bridge two domains. Despite substantial progress on the topic, there exist several problems with the previous methods. First, there is a domain gap between training and testing pose sequences--the model is tested on poses it has not seen during training, such as difficult dancing moves. Furthermore, pose detection errors are inevitable, making the job of the generator harder. Finally, generating realistic pixels from sparse poses is challenging in a single step. To address these challenges, we introduce a novel pose-to-video translation framework for generating high-quality videos that are temporally coherent even for in-the-wild pose sequences unseen during training. We propose a pose augmentation method to minimize the training-test gap, a unified paired and unpaired learning strategy to improve the robustness to detection errors, and two-stage network architecture to achieve superior texture quality. To further boost research on the topic, we build two human motion datasets. Finally, we show the superiority of our approach over the state-of-the-art studies through extensive experiments and evaluations on different datasets.

研究の動機と目的

  • トレーニング時とテスト時のポーズシーケンスのドメインギャップ、特にトレーニング中に見られなかった未収録のポーズに対して、特に顕著なギャップを解消する。
  • 実世界の動画におけるキーポイントの欠落やずれといったポーズ検出エラーに対する耐性を向上させる。
  • スプライスドポーズ入力からの高忠実で時間的に整合性のある動画生成を実現するため、フォアグラウンドのみの合成に焦点を当てる。
  • ペアド教師あり学習とunpairedデータの間のギャップを埋めるために、統一されたペアドおよびunpaired学習戦略を導入する。
  • トレーニング分布外の極端なまたは複雑な動きに対しても、リアルなテクスチャ生成と動きの一貫性を実現する。

提案手法

  • 2段階のネットワークアーキテクチャを導入する:まず、ポーズから画像への変換ネットワークが初期のフォアグラウンドフレームを生成し、次にリファインメントネットワークがテクスチャの質とシャープネスを向上させる。
  • トレーニング中にポーズ増強を適用し、キーポイントチャネルをランダムにドロップさせたり、体部の長さをリサイズさせたりすることで、検出エラーを模擬し、耐性を向上させる。
  • 大規模な単一人物アクティビティ(SPA)データセットを未収録のソースデータとして用い、unpaired学習をトレーニングパイプラインに統合することで、未観測のポーズへの一般化を可能にする。
  • ペアドおよびunpairedトレーニングブランチの両方をサポートする統合ディスクリミネータ設計を採用し、ドメイン間で共同最適化を可能にする。
  • 背景アーチファクトの低減、計算効率の向上、および容易な背景置換を可能にするために、フォアグラウンドのみの生成に焦点を当てる。
  • 連続するポーズシーケンスを入力としてスタックすることで、フレーム間の時間的整合性を保持する。

実験結果

リサーチクエスチョン

  • RQ1トレーニングデータとは顕著に異なる未収録のポーズシーケンスに対しても、ポーズから動画へのモデルが効果的に一般化できるか?
  • RQ2動画生成中にポーズ検出エラーをどのように軽減できるか、構造的一致性とリアリズムを維持するか?
  • RQ31段階生成と比較して、2段階のリファインメントネットワークは、テクスチャ品質の向上とアーチファクトの低減にどの程度寄与するか?
  • RQ4ペアド学習とunpaired学習を組み合わせることで、完全に教師あり学習に比べて一般化性と耐性が向上するか?
  • RQ5フォアグラウンドのみの合成は、動き移行タスクにおいて、フルフレーム生成に比べて視覚的忠実度と再利用性が向上するか?

主な発見

  • 完全な手法(PL-UL-Stage2)は、SSIM 0.9666およびFID 5.9453を達成し、アブレーションバリアントおよびSOTAベースラインを著しく上回った。
  • ポーズ増強(DA)により耐性が向上し、キーポイント検出エラー下でもアーチファクトが減少し、vid2vidとの定性的比較で一貫性が向上した。
  • 2段階のリファインメントネットワークは、テクスチャの詳細と境界の正確性を顕著に向上させ、1段階モデルと比較して穴や欠落した四肢が減少した。
  • unpaired学習により、未観測の未収録ポーズへの一般化が向上し、トレーニングデータ外の複雑または極端な動きに対しても、成功した動き移行が可能になった。
  • 視覚的アブレーションスタディにより、特にunpaired学習やリファインメントのいずれかのコンponentを除去すると、目立つアーチファクト、ぼやけたテクスチャ、一貫性のない身体部位が生じることが確認された。
  • 図4の挑戦的なケースで示されるように、入力ポーズに欠落やずれのあるキーポイントが含まれても、完全で整合的でリアルなフォアグラウンド画像を効果的に生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。