Skip to main content
QUICK REVIEW

[論文レビュー] StyleGAN-Human: A Data-Centric Odyssey of Human Generation

Jianglin Fu, Shikai Li|arXiv (Cornell University)|Apr 25, 2022
Face recognition and analysis被引用数 5
ひとこと要約

本稿では、23万枚のフルボディ画像から構成される大規模かつ多様なデータセット(SHHQ)を用いた、無条件のリアルな人間画像生成のためのデータ中心的アプローチ、StyleGAN-Humanを紹介する。大規模なデータ(4万枚以上)、ポーズごとのバランスの取れたデータ分布、およびボディセンターのアライメントが生成品質を著しく向上させることを示しており、公開されたモデルズーと編集ベンチマークを通じて、今後の人体生成および編集分野の研究を促進する。

ABSTRACT

Unconditional human image generation is an important task in vision and graphics, which enables various applications in the creative industry. Existing studies in this field mainly focus on "network engineering" such as designing new components and objective functions. This work takes a data-centric perspective and investigates multiple critical aspects in "data engineering", which we believe would complement the current practice. To facilitate a comprehensive study, we collect and annotate a large-scale human image dataset with over 230K samples capturing diverse poses and textures. Equipped with this large dataset, we rigorously investigate three essential factors in data engineering for StyleGAN-based human generation, namely data size, data distribution, and data alignment. Extensive experiments reveal several valuable observations w.r.t. these aspects: 1) Large-scale data, more than 40K images, are needed to train a high-fidelity unconditional human generation model with vanilla StyleGAN. 2) A balanced training set helps improve the generation quality with rare face poses compared to the long-tailed counterpart, whereas simply balancing the clothing texture distribution does not effectively bring an improvement. 3) Human GAN models with body centers for alignment outperform models trained using face centers or pelvis points as alignment anchors. In addition, a model zoo and human editing applications are demonstrated to facilitate future research in the community.

研究の動機と目的

  • 無条件人間画像生成における包括的なデータ中心的分析の不足に取り組むこと、特にデータサイズ、分布、およびアライメントに焦点を当てる。
  • 1024×512解像度以上で、多様なポーズと衣類テクスチャをアノテートした、23万枚を超える高品質なフルボディ画像を含む大規模データセット(SHHQ)を収集・アノテートすること。
  • データエンジニアリング要因(データサイズ、データ分布、データアライメント)が、StyleGANベースの人間生成品質に与える影響を調査すること。
  • コミュニティ利用を目的として、6つの事前学習済みStyleGANモデル(StyleGAN、StyleGAN2、アリエイズ・StyleGAN)を1024×512および512×256解像度で公開するモデルズーを構築すること。
  • 顔の編集手法(例:PTI、InterFaceGAN)をフルボディ画像生成に適応することで、人間の編集ベンチマークを構築・検証すること。

提案手法

  • 23万枚の高解像度フルボディ画像を収集・整備した、スタイリッシュ・ハーマンズ・HQ(SHHQ)データセットを構築し、多様なポーズと衣類テクスチャをアノテートした。
  • 生成忠実度へのデータ量の影響を評価するため、4,000枚から23万枚までのさまざまなデータサイズで、バニラStyleGANベースのモデルを学習した。
  • 長尾分布とバランスの取れたデータ分布の両方を用いて学習を比較し、特にレアな顔のポーズや衣類テクスチャに対する影響を分析した。
  • キーポイントベースの正規化を用いて、顔中心、仙骨点、ボディセンターの3つのアライメント方式を評価し、トレーニング中のデータアライメントに影響を与えた。
  • 事前学習済みモデルを用いて、顔中心の編集手法(PTI、InterFaceGAN、StyleSpace、SeFa)をフルボディ画像に適応することで、人間の編集ベンチマークを構築した。
  • 再現可能性および後続応用を目的として、6つのモデル(3つのアーキテクチャ × 2つの解像度)とコードを含むモデルズーを公開した。

実験結果

リサーチクエスチョン

  • RQ1バニラStyleGANアーキテクチャを用いた高忠実度の無条件人間画像生成モデルを訓練するための最小データサイズは何か?
  • RQ2顔のポーズや衣類テクスチャにおけるデータ分布の不均衡は、希少または代表されていない属性の生成品質にどのように影響するか?
  • RQ3顔中心、仙骨点、ボディセンターのうち、どのアライメント戦略がStyleGANベースの人間画像生成モデルの性能を最も向上させるか?

主な発見

  • バニラStyleGANアーキテクチャを用いた高忠実度の無条件人間画像生成モデルを訓練するには、最低4万枚の画像が必要である。
  • 顔のポーズのデータ分布をバランスさせることで、希少なポーズの生成品質が向上するが、衣類テクスチャの分布をバランスさせても顕著な改善は得られない。
  • ボディセンターのアライメントを用いて学習したモデルが、顔中心や仙骨点アライメントのモデルを上回り、より優れた構造的一致性を示した。
  • 公開されたモデルズーにより、最先端の顔の編集手法(例:InterFaceGAN、PTI)をフルボディ人間画像に効果的に適応でき、リアルで自然な編集結果を生成できた。
  • InsetGANベースの融合により、別々のモデルから得た顔と体を統合することで、多様で一貫性のあるフルボディ画像を生成でき、モデルズーがマルチコンponent生成に有用であることを示した。
  • 人間の編集ベンチマークは、顔とは異なり、潜在空間における人間の属性を分離することはより複雑であることを明らかにした。これは、属性制御における課題を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。