Skip to main content
QUICK REVIEW

[論文レビュー] Pose-Guided High-Resolution Appearance Transfer via Progressive Training

Ji Liu, Heshan Liu|arXiv (Cornell University)|Aug 27, 2020
Generative Adversarial Networks and Image Synthesis参考文献 44被引用数 6
ひとこと要約

本論文は、3Dモデルを用いずに、局所的知覚損失および局所的識別器を用いて細部を保持し、隠れた領域を想起することで、高解像度(1024²)の外観転送を段階的・ポーズガイド付きの深層エンコーダデコーダネットワークで実現する手法を提案する。本手法は、顕著なポーズ変化下でも、写真のようにリアルな人間の画像合成において最先端の結果を達成する。

ABSTRACT

We propose a novel pose-guided appearance transfer network for transferring a given reference appearance to a target pose in unprecedented image resolution (1024 * 1024), given respectively an image of the reference and target person. No 3D model is used. Instead, our network utilizes dense local descriptors including local perceptual loss and local discriminators to refine details, which is trained progressively in a coarse-to-fine manner to produce the high-resolution output to faithfully preserve complex appearance of garment textures and geometry, while hallucinating seamlessly the transferred appearances including those with dis-occlusion. Our progressive encoder-decoder architecture can learn the reference appearance inherent in the input image at multiple scales. Extensive experimental results on the Human3.6M dataset, the DeepFashion dataset, and our dataset collected from YouTube show that our model produces high-quality images, which can be further utilized in useful applications such as garment transfer between people and pose-guided human video generation.

研究の動機と目的

  • 参照画像からターゲットポーズへの高解像度(1024²)のポーズガイド付き外観転送を、3Dモデルを一切使用せずに実現すること。
  • 顕著なポーズ変化および自己遮蔽下でも、複雑な衣類のテクスチャや顔貌特徴を保持すること。
  • 外観転送の過程で、以前に遮られていた身体部位を現実的に想起すること。
  • 新しい損失設計により、局所的細部の忠実度とグローバルな整合性を向上させること。
  • バーチャルトライオンや高解像度人間映像生成などの応用分野における汎用性と実用性を示すこと。

提案手法

  • 粗い段階から細かい段階へと訓練される段階的エンコーダデコーダアーキテクチャを用いて、1024²解像度の出力を生成する。
  • 自動符号化器のボトルネックに、ターゲットポーズ表現(18キーポイントヒートマップ)を統合することでポーズガイドを実現する。
  • 44の局所的領域に局所的知覚損失を適用し、細分化された細部の保持を強化する。
  • 最高解像度(1024²)に局所的識別器を導入し、局所的なパッチにおけるリアルなテクスチャ生成を強制する。
  • グローバルな知覚損失を、正解画像と生成画像の間に適用することで、全体的な画像品質を保証する。
  • スキップ接続をデコーダーに用いることで、スケール間での空間情報を保持する。

実験結果

リサーチクエスチョン

  • RQ12Dベースの深層ネットワークは、3Dの監視なしに高解像度(1024²)のポーズガイド付き外観転送を達成できるか?
  • RQ2局所的知覚損失および局所的識別器は、細部の保持と隠れた領域の想起にどの程度効果的か?
  • RQ3段階的訓練は、外観転送における生成画像の品質と解像度を向上させるか?
  • RQ4本手法は、複雑なテクスチャとポーズ変化を伴う多様なデータセットに一般化可能か?
  • RQ5本手法は、バーチャルトライオンや高解像度動画生成などの後続タスクにどの程度応用可能か?

主な発見

  • DeepFashionデータセットにおいて、本手法はSSIM 0.806、MS-SSIM 0.814、LPIPS 0.198を達成し、先行SOTA手法を上回った。
  • YouTubeデータセットでは、顕著なポーズ変化および自己遮蔽下でも、複雑な衣類のテクスチャや顔貌特徴を効果的に保持した。
  • アブレーションスタディの結果、局所的記述子と段階的訓練の両方が生成品質を著しく向上させ、併用することで最良の結果が得られた。
  • 本モデルは1024²解像度で写真のようにリアルな画像を生成し、ズームイン画像では細部の忠実な再構成と、露出した領域の現実的な想起が確認された。
  • 本手法により、まずターゲット画像の隠れ部分を復元し、次に外観フローを用いて衣類の外観を転送することで、高品質なバーチャルトライオンが実現された。
  • ポーズガイド付き人間映像生成の分野では、顔貌特徴と詳細な衣類が保持された1024²解像度のフレームを生成し、解像度と細部の忠実度において先行手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。