[論文レビュー] Person Image Synthesis via Denoising Diffusion Model
本稿では、ポーズと外見を条件として、高精細で写真のようなリアルな人物画像を合成するためのノイズ除去拡散フレームワーク、Person Image Diffusion Model (PIDM) を提案する。画像変換を段階的なノイズ除去ステップに分解し、分離された分類器フリーのガイドランスを備えたテクスチャ拡散モジュールを導入することで、DeepFashion および Market-1501 で最先端の性能を達成し、正確なテクスチャ保存と向上した多様性を実現した、明確でリアルな画像を生成した。
The pose-guided person image generation task requires synthesizing photorealistic images of humans in arbitrary poses. The existing approaches use generative adversarial networks that do not necessarily maintain realistic textures or need dense correspondences that struggle to handle complex deformations and severe occlusions. In this work, we show how denoising diffusion models can be applied for high-fidelity person image synthesis with strong sample diversity and enhanced mode coverage of the learnt data distribution. Our proposed Person Image Diffusion Model (PIDM) disintegrates the complex transfer problem into a series of simpler forward-backward denoising steps. This helps in learning plausible source-to-target transformation trajectories that result in faithful textures and undistorted appearance details. We introduce a 'texture diffusion module' based on cross-attention to accurately model the correspondences between appearance and pose information available in source and target images. Further, we propose 'disentangled classifier-free guidance' to ensure close resemblance between the conditional inputs and the synthesized output in terms of both pose and appearance information. Our extensive results on two large-scale benchmarks and a user study demonstrate the photorealism of our proposed approach under challenging scenarios. We also show how our generated images can help in downstream tasks. Our code and models will be publicly released.
研究の動機と目的
- GANベースの手法が人物画像合成において抱える限界、たとえばテクスチャの変形や複雑なポーズ下での一般化性能の低さを解消すること。
- 拡散モデルの本質的な安定性と多様性を活用し、高精細で制御可能な人物画像生成を実現すること。
- パースマップや3次元対応関係のような密なアノテーションに依存しないように、暗黙の外見-ポーズ対応関係を学習すること。
- グローバル構造とリアルなテクスチャを保持しながら、モードカバレッジとサンプルの多様性を向上させること。
- 生成画像の有用性を、人物再識別などの下流タスクにおいて実証すること。
提案手法
- 人物画像生成を、ポーズと外見を条件として、潜在ガウス分布からのノイズを段階的に除去する拡散プロセスとして定式化する。
- クロスアテンションを用いて、ソース外見特徴とターゲットポーズ特徴の対応関係をモデル化するテクスチャ拡散モジュールを導入し、アーティファクトのないテクスチャ転送を実現する。
- サンプリング段階で分離された分類器フリーのガイドランスを採用し、ポーズと外見の整合性を独立して制御することで、入力条件への忠実度を保証する。
- マスクされた潜在変数のリファインメントを伴うDDIMサンプリングを用い、参照画像からの領域を特定的に保持または置き換えることで、外見編集を可能にする。
- ノイズの球面線形補間とスタイル特徴の線形補間を用いてスタイル補間を実施し、画像間での滑らかなスタイル転送を実現する。
- U-Netバックボーンにアテンション機構と学習可能なノイズスケジュールを備えたモデルを、DeepFashion および Market-1501 でエンドツーエンドに訓練する。

実験結果
リサーチクエスチョン
- RQ1GANに比べて、拡散アプローチが正確なポーズと外見制御を実現する写真のようなリアルな人物画像を生成する上で優れているかどうか。
- RQ2パースマップや3次元対応関係のような密な教師信号がなくても、拡散モデルが複雑な外見-ポーズ対応関係をどれほど効果的に学習できるか。
- RQ3分離された分類器フリーのガイドランスが、入力条件と生成出力の整合性をどの程度向上させるか。
- RQ4PIDM が生成する画像が、人物再識別などの下流タスクにおける有効なデータ拡張として機能するか。
- RQ5ベンチマークデータセット上で、既存の最先端手法と比較して、PIDM は多様性と忠実度の両面でどの程度優れているか。
主な発見
- PIDM は DeepFashion および Market-1501 で新たな最先端性能を達成し、それぞれ Fréchet Inception Distance (FID) が 10.2 および 11.8 と、先行手法を上回った。
- 分離された分類器フリーのガイドランスを用いることで、テクスチャ拡散を備えたベースラインと比較し、FID が 1.1462 減少、SSIM が 0.0134 増加、LPIPS が 0.0194 減少した。
- ユーザー研究において、人間の評価者は、複雑なポーズや被覆状態下でも、リアルさ、鮮明さ、外見の一貫性の点で PIDM が生成した画像を好んだ。
- モデルは滑らかな外見編集を可能にした:ソース画像のテクスチャを参照画像に自然に統合し、構造的一致性を保持した。
- DDIMサンプリングによるスタイル補間は、衣類スタイル間で滑らかで自然な遷移を生み出し、制御性と視覚的品質を示した。
- 人物再識別におけるデータ拡張として用いた場合、30K枚の合成画像を100%の実データセットに追加したことで、Market-1501 でのmAPが78.4%に上昇し、先行手法を上回った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。