Skip to main content
QUICK REVIEW

[論文レビュー] HumanDiffusion: a Coarse-to-Fine Alignment Diffusion Framework for Controllable Text-Driven Person Image Generation

Kaiduo Zhang, Muyi Sun|arXiv (Cornell University)|Nov 11, 2022
Human Pose and Action Recognition被引用数 12
ひとこと要約

HumanDiffusionは、オープンボキャブラリーの記述とセマンティックポーズマップを用いて、制御可能でテキスト駆動型の人物画像生成を実現する拡散ベースのフレームワークを提案する。粗くから細かくまでのアライメント戦略を、スタイライズドメモリリtrieval(SMR)モジュールとマルチスケールクロスモダリティアライメント(MCA)モジュールを介して実装し、DeepFashionデータセットにおいて、画像品質、忠実度、編集可能性の面で最先端のパフォーマンスを達成した。

ABSTRACT

Text-driven person image generation is an emerging and challenging task in cross-modality image generation. Controllable person image generation promotes a wide range of applications such as digital human interaction and virtual try-on. However, previous methods mostly employ single-modality information as the prior condition (e.g. pose-guided person image generation), or utilize the preset words for text-driven human synthesis. Introducing a sentence composed of free words with an editable semantic pose map to describe person appearance is a more user-friendly way. In this paper, we propose HumanDiffusion, a coarse-to-fine alignment diffusion framework, for text-driven person image generation. Specifically, two collaborative modules are proposed, the Stylized Memory Retrieval (SMR) module for fine-grained feature distillation in data processing and the Multi-scale Cross-modality Alignment (MCA) module for coarse-to-fine feature alignment in diffusion. These two modules guarantee the alignment quality of the text and image, from image-level to feature-level, from low-resolution to high-resolution. As a result, HumanDiffusion realizes open-vocabulary person image generation with desired semantic poses. Extensive experiments conducted on DeepFashion demonstrate the superiority of our method compared with previous approaches. Moreover, better results could be obtained for complicated person images with various details and uncommon poses.

研究の動機と目的

  • 事前定義された語彙に依存せず、自由形式の記述を用いて柔軟で使いやすいテキスト駆動型人物画像生成を可能にすること。
  • 複雑な人体の外見における、複数モodal特徴の統合とアライメントに課題を抱える先行手法の限界を解消すること。
  • 複雑なポーズ下でも、多様で詳細な人物画像を生成する際の画像品質と構造的一致性を向上させること。
  • 局所的な編集を可能にする生成をサポートし、変更されていない領域を保持しながらテキストまたはセマンティックマップを介して編集できること。
  • 実用的なデプロイメントを想定したコンactなアーキテクチャでエンドツーエンド学習を実現すること。

提案手法

  • 外見特徴を拡散の前段階で精錬するために、分離されたメモリネットワークを用いるスタイライズドメモリリtrieval(SMR)モジュールを導入し、細分化された特徴の抽出を向上させる。
  • 複数の解像度レベルでテキストと画像表現の間の粗くから細かくまでの特徴アライメントを実行するマルチスケールクロスモダリティアライメント(MCA)モジュールを採用する。
  • 各ノイズ除去ステップでCLIPから得られるテキスト埋め込みと画像特徴をアライメントするため、クロスアテンション機構を用いたエンドツーエンドで訓練された拡散モデルアーキテクチャを活用する。
  • 部分的編集のための二重ノイズ除去戦略(グローバルおよびローカル)を組み込み、テキストプロンプトがローカル特徴の精錬を誘導する一方で、画像の他の領域を保持する。
  • 生成過程での空間的レイアウトと構造をガイドするために、セマンティックポーズマップを条件付き事前分布として活用する。
  • 編集過程でCLIPベースの特徴距離の最小化を実施し、テキストプロンプトとターゲット画像領域を一致させる(例:ジャケットの色をグレーからブルーに変更)。

実験結果

リサーチクエスチョン

  • RQ1拡散ベースのフレームワークは、オープンボキャブラリーのテキスト記述とセマンティックポーズマップを用いて、高忠実度で制御可能な人物画像生成を達成できるか?
  • RQ2複数のスケールと解像度にわたり、テキストと画像特徴のクロスモダリティアライメントをどのように改善できるか?
  • RQ3先行手法が失敗するような複雑なポーズや遮蔽状況下でも、モデルは多様で高品質な人物画像を生成できるか?
  • RQ4テキストまたはセマンティックマップを用いて、画像の他の領域を変更せずに柔軟かつ局所的な編集をどの程度可能にするか?
  • RQ5提案された粗くから細かくまでのアライメント機構は、画像品質およびキャプションアライメントの観点で、既存手法と比較してどの程度優れているか?

主な発見

  • HumanDiffusionはDeepFashionデータセットにおいて、FIDスコアが31.28を達成し、Text2Human(30.89)および他のベースラインモデルを上回り、画像品質に優れた。
  • LPIPSスコアが0.2001に低下し、MS-SSIMが0.7736に上昇したため、先行手法と比較して優れた知覚的忠実度と構造的一致性を示した。
  • HumanDiffusionは、側顔や交差する脚といった複雑な状況でも、Text2Humanや他のGANベースのモデルと比較して、よりフォトリアルで多様な画像を生成した。
  • ユーザープレファレンス評価において、画像のフォトリアルさとキャプション類似度の両面で、ベースラインを上回るスコアを獲得した。
  • モデルは局所的編集(例:衣類の色やスタイルの変更)を成功裏に実現し、他の領域を保持したまま、優れた制御性を示した。
  • 遮蔽されたポーズや詳細なテクスチャの状況において、Leg mixing や不自然なエッジ歪みといったアーチファクトを、Text2Humanで一般的に見られるものよりも低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。