Skip to main content
QUICK REVIEW

[論文レビュー] Text2Human: Text-Driven Controllable Human Image Generation

Yuming Jiang, Shuai Yang|arXiv (Cornell University)|May 31, 2022
Generative Adversarial Networks and Image Synthesis被引用数 15
ひとこと要約

Text2Humanは、衣類の形状に関するテキスト記述をパースングマップに変換し、階層的でテクスチャに配慮したVQ-VAEと拡散ベースのトランスフォーマーサンプラー、およびエキスパートの混合を用いたテクスチャ合成により、制御可能で高精細な人間の画像生成を実現する2段階のテキスト駆動フレームワークを提案する。本手法は、細分化されたテクスチャ生成において特に優れた結果を示し、インデックス予測の推論速度が従来手法の25分から0.6秒に短縮された。

ABSTRACT

Generating high-quality and diverse human images is an important yet challenging task in vision and graphics. However, existing generative models often fall short under the high diversity of clothing shapes and textures. Furthermore, the generation process is even desired to be intuitively controllable for layman users. In this work, we present a text-driven controllable framework, Text2Human, for a high-quality and diverse human generation. We synthesize full-body human images starting from a given human pose with two dedicated steps. 1) With some texts describing the shapes of clothes, the given human pose is first translated to a human parsing map. 2) The final human image is then generated by providing the system with more attributes about the textures of clothes. Specifically, to model the diversity of clothing textures, we build a hierarchical texture-aware codebook that stores multi-scale neural representations for each type of texture. The codebook at the coarse level includes the structural representations of textures, while the codebook at the fine level focuses on the details of textures. To make use of the learned hierarchical codebook to synthesize desired images, a diffusion-based transformer sampler with mixture of experts is firstly employed to sample indices from the coarsest level of the codebook, which then is used to predict the indices of the codebook at finer levels. The predicted indices at different levels are translated to human images by the decoder learned accompanied with hierarchical codebooks. The use of mixture-of-experts allows for the generated image conditioned on the fine-grained text input. The prediction for finer level indices refines the quality of clothing textures. Extensive quantitative and qualitative evaluations demonstrate that our proposed framework can generate more diverse and realistic human images compared to state-of-the-art methods.

研究の動機と目的

  • 衣類の形状とテクスチャに対して明示的な制御が可能な多様で高精細な人間の画像生成の課題に取り組むこと。
  • 非エキスパートユーザーが直感的かつテキストベースで全身の人間の画像を生成できるようにすること。
  • 従来のモデルが複雑な衣類パターンを生成できず、細分化されたテクスチャ制御を欠いているという限界を克服すること。
  • 衣類のマルチスケールな構造的特徴と詳細なテクスチャ表現を捉えるスケーラブルで階層的なコードブックシステムを開発すること。
  • フォワードパスインデックス予測ネットワークを用いて、階層的VQ-VAEに基づく画像生成における推論速度を向上させるとともに、テクスチャ品質を向上させること。

提案手法

  • フレームワークは2段階のパイプラインを採用する:まずポーズと衣類形状のテキスト記述から人間のパースングマップを生成し、次にテキスト誘導のテクスチャ詳細を用いて最終的な画像を合成する。
  • 粗いレベルのコードブックは構造的テクスチャ特徴を捉え、細かいレベルのコードブックは詳細なテクスチャをモデル化する、テクスチャに配慮した階層的VQ-VAEを導入する。
  • 細分化されたテキスト入力に条件づけられた画像生成を可能にするために、エキスパートの混合を用いた拡散ベースのトランスフォーマーサンプラーを用いる。これにより、多様で制御可能な出力が得られる。
  • 粗いレベルのインデックスから細かいレベルのコードブックインデックスを予測するフォワードパスインデックス予測ネットワークを提案し、推論時間を25分から0.6秒に短縮する。
  • サンプリングされたコードブックインデックスから高品質な人間の画像を再構成できるように、デコーダーを階層的コードブックと共同で訓練する。
  • 衣類の形状とテクスチャに細分化されたアノテーションが施された新しい大規模データセット、DeepFashion-MultiModalを活用する。

実験結果

リサーチクエスチョン

  • RQ1テキスト駆動フレームワークは、衣類の形状とテクスチャに対して明示的な制御が可能な多様で現実的な人間の画像を生成できるか?
  • RQ2階層的コードブックは、複雑な衣類パターンのマルチスケールなテクスチャ表現を効果的にモデル化できるか?
  • RQ3フォワードパスインデックス予測ネットワークは、品質を損なわせることなく、階層的VQ-VAEに基づく画像生成における推論速度を顕著に向上させられるか?
  • RQ4エキスパートの混合サンプラーは、テキスト条件付き画像合成における制御性と多様性をどの程度向上させるか?
  • RQ5本フレームワークは、レアなポーズや、チェック柄のような未発表のテクスチャに対してどの程度の性能を示すか?

主な発見

  • 提案されたフォワードパスインデックス予測ネットワークにより、推論時間が25分から0.6秒に短縮されるとともに、テクスチャ再構成品質が向上した。
  • LPIPSおよびArcFaceの指標から、本手法を用いて再構成された画像がVQVAE2の結果よりも真値に近いことが確認され、優れた再構成性能が裏付けられた。
  • 定性的な結果から、Text2Humanは、ラティスやチェック柄のような複雑なパターンを含む、より現実的で多様な衣類テクスチャを生成できていることが示された。
  • 本フレームワークは、複雑な衣類形状とテクスチャに対して特に優れた細分化された制御を備えた高精細な画像生成において、既存のモデルを上回っている。
  • 珍しいポーズやレアなテクスチャ(例:チェック柄)に対しては失敗事例が観察され、データのアンバランスとモデルの一般化能力の限界が原因であると示唆された。
  • 本モデルは多様なテキストプロンプトに対して頑健であるが、離散的単語埋め込みの制限により、標準的でないスリーブ長の表現には限界がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。