Skip to main content
QUICK REVIEW

[論文レビュー] HumanGAN: A Generative Model of Humans Images

Kripasindhu Sarkar, Lingjie Liu|arXiv (Cornell University)|Mar 11, 2021
Generative Adversarial Networks and Image Synthesis参考文献 46被引用数 4
ひとこと要約

HumanGAN は、ポーズに依存しない外見をパーツ固有の潜在ベクトルにエンコードし、それを異なるポーズにワープすることで、人間の画像生成における分離可能でパーツレベルの制御を可能にする、革新的な生成的対抗的モデルである。512×512解像度で、グローバルな外見サンプリング、ポーズ転送、パーツレベルの生成において最先端の性能を達成し、高い現実性と多様性を実現している。

ABSTRACT

Generative adversarial networks achieve great performance in photorealistic image synthesis in various domains, including human images. However, they usually employ latent vectors that encode the sampled outputs globally. This does not allow convenient control of semantically-relevant individual parts of the image, and is not able to draw samples that only differ in partial aspects, such as clothing style. We address these limitations and present a generative model for images of dressed humans offering control over pose, local body part appearance and garment style. This is the first method to solve various aspects of human image generation such as global appearance sampling, pose transfer, parts and garment transfer, and parts sampling jointly in a unified framework. As our model encodes part-based latent appearance vectors in a normalized pose-independent space and warps them to different poses, it preserves body and clothing appearance under varying posture. Experiments show that our flexible and general generative method outperforms task-specific baselines for pose-conditioned image generation, pose transfer and part sampling in terms of realism and output resolution.

研究の動機と目的

  • 既存の GAN を用いた人物画像生成モデルにおける細分化された分離可能制御の欠如に対処すること。
  • アイデンティティと外見をポーズにわたって保持しつつ、ボディパーツと衣類スタイルを独立してサンプリングおよび操作できること。
  • グローバルサンプリング、ポーズ転送、パーツサンプリング、衣類転送といった複数の人物画像生成タスクを、1つの生成フレームワークに統合すること。
  • 確率的でないか、ローカライズドな外見編集ができない既存手法の制限を克服すること。
  • 持続的アイデンティティとポーズ変動下でのリアルな外見を備えた、高精細で 512×512 解像度の画像合成を達成すること。

提案手法

  • ポーズに依存しない外見空間におけるパーツ固有の潜在ベクトルの事後分布をモデル化するため、条件付き変分オートエンコーダー(VAE)フレームワークを用いる。
  • 個々のボディパーツ(例:頭部、上半身)に対応するパーツベースのノイズベクトル($\bm{z}[k]$)を用いて外見をエンコードすることで、局所的制御を可能にする。
  • DensePose の監視を用いて、画像再構築の前に、エンコードされたパーツベクトルをターゲットポーズにあわせるために空間的ワープを適用する。
  • ボディと衣類パーツのベクトルを統合したノイズ埋め込みを構築し、スタイル転送を伴うボディと衣類の共同生成を可能にする。
  • ワープされた潜在ベクトルに条件付けられた高精細な生成ネットワークを用いて、写真のようにリアルな画像を合成する。
  • 潜在ベクトルをボディパーツに条件付け、それらを独立してワープすることで、ポーズと外見を分離する新しいディセントレート戦略を導入する。

実験結果

リサーチクエスチョン

  • RQ11つの生成モデルが、人物画像生成におけるグローバル外見サンプリング、ポーズ転送、パーツレベルの編集を同時にサポートできるか?
  • RQ2微分可能で制御可能な方法で、ポーズ依存変換からポーズ不変の外見表現を効果的に分離できるか?
  • RQ3パーツ固有の潜在ベクトルは、画像の他の部分に影響を与えずに、多様でリアルな個々のボディパーツのサンプリングをどの程度可能にするか?
  • RQ4モデルは、リアルさと解像度(512×512)の両面で最先端の性能を達成できるか?
  • RQ5ポーズ転送とパーツサンプリングにおいて、アイデンティティ保持と視覚的品質の観点から、タスク特化型ベースラインと比較してどうなるか?

主な発見

  • HumanGAN は、512×512 解像度で、タスク特化型ベースラインを上回り、グローバル外見サンプリングにおいてよりリアルで多様な結果を達成した。
  • ユーザースタディーでは、ポーズ転送におけるアイデンティティ保持について 65.62% の参加者が HumanGAN を好んだのに対し、CBI は 21.88%、NHRR は 12.5% であった。
  • リアルさの観点では、81.25% のユーザーが HumanGAN を好んだが、CBI は 6.25%、NHRR は 12.5% にとどまった。
  • 定量的評価では、NoParts ベースラインと比較して、Variation–Part が 22% 向上(0.37 対 0.45)、Variation–Rest が 75% 減少(0.11 対 0.44)した。これは、優れたパーツレベルのディセントレート性を裏付けている。
  • 別々のボディおよび衣類画像からのパーツ固有の潜在ベクトルを組み合わせることで、衣類転送が成功し、整合的でリアルな結果が得られた。
  • DeepFashion データセットに起因する偶発的なパーツの重複や性別バイアスといった制限はあったが、HumanGAN は全評価タスクにおいて強固な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。