[論文レビュー] Pose with Style: Detail-Preserving Pose-Guided Image Synthesis with Conditional StyleGAN
本論文では、条件付きStyleGAN2ジェネレータにおける空間的に変化するモードと対称性誘導型対応フィールドインpaintingネットワークを活用することで、1枚のソース画像から細部を保持したポーズ付き画像合成手法を提案する。本手法は3Dに意識的な特徴転送とスタイリスティックな生成を組み合わせることで、写真のようにリアルなポーズ変更およびバーチャルトライオンにおいて最先端の結果を達成し、アーチファクトを顕著に低減し、細部の保持を向上させる。
We present an algorithm for re-rendering a person from a single image under arbitrary poses. Existing methods often have difficulties in hallucinating occluded contents photo-realistically while preserving the identity and fine details in the source image. We first learn to inpaint the correspondence field between the body surface texture and the source image with a human body symmetry prior. The inpainted correspondence field allows us to transfer/warp local features extracted from the source to the target view even under large pose changes. Directly mapping the warped local features to an RGB image using a simple CNN decoder often leads to visible artifacts. Thus, we extend the StyleGAN generator so that it takes pose as input (for controlling poses) and introduces a spatially varying modulation for the latent space using the warped local features (for controlling appearances). We show that our method compares favorably against the state-of-the-art algorithms in both quantitative evaluation and visual comparison.
研究の動機と目的
- 任意のポーズ下での単一画像からの人間の再ポーズ化において、細粒度のアイデンティティおよびテクスチャ細部を保持する課題に対処すること。
- 既存手法がオクルージョン領域を不正確に想起するか、衣類パターンや顔貌特徴を維持できないという制限を克服すること。
- 3Dに意識的な特徴転送とスタイリスティックな生成を組み合わせた、制御可能で写真的にリアルな画像生成フレームワークを開発すること。
- 衣類をソース画像から新しいポーズに転送しながら外観細部を保持することで、高精細なバーチャルトライオンを実現すること。
- ポーズ条件付きStyleGANに空間的に変化するモードを導入することで、生成画像のアーチファクトを低減すること。
提案手法
- 対称性誘導型インpaintingネットワークが、3Dボディ表面とソース画像間の対応フィールドを補完し、大規模なポーズ変化に対しても頑健な特徴転送を可能にする。
- ソース画像からのローカル外観特徴が、補完された対応フィールドを用いてターゲットポーズにワープされ、空間的細部が保持される。
- ポーズ条件付きStyleGAN2ジェネレータは、ワープされた特徴が複数のレイヤーで潜在空間をモードする空間的に変化するモードを拡張して拡張され、外観制御が可能になる。
- ジェネレータはターゲットポーズとワープされたローカル特徴の両方で条件付けられており、ポーズとアイデンティティの分離制御が可能になる。
- UV空間セグメンテーションマップを用いて、複数のソース画像からの特徴を組み合わせて衣類転送を実現し、部分的外観転送を可能にする。
- 事前に計算されたマッピングテーブルを用いて、UV空間セグメンテーションを2Dターゲットポーズに変換し、複数ソースからの特徴統合による衣類合成を可能にする。
実験結果
リサーチクエスチョン
- RQ1大規模なポーズ変動下でも、2Dソース画像と3Dボディ表面間の対応フィールドを補完するために、対称性の事前知識が有効に機能するか?
- RQ2StyleGAN2ジェネレータにおける空間的に変化するモードが、グローバルモードよりもソース画像からの細粒度テクスチャ細部をよりよく保持できるか?
- RQ3本手法は、ポーズ転送におけるアイデンティティおよび衣類パターンの保持において、最先端の手法と比較してどのように優れているか?
- RQ4本手法は、多様なボディシェイプおよびスカートや長い髪といった複雑な衣類に対し、どの程度一般化可能か?
- RQ5複数のソース画像からの特徴を組み合わせることで、衣類転送を実現するフレームワークがバーチャルトライオンをサポートできるか?
主な発見
- 提案手法はPSNR 18.9657、SSIM 0.7919、FID 8.1434、LPIPS 0.124を達成し、定量的指標においてベースライン手法を上回る。
- 対称性を用いた対応フィールドインpaintingは、非対称性ベースラインと比較してPSNRを0.0847向上させ、FIDを0.3806低下させる。
- UVマップを不完全または完全に使用するのではなく、画像ベースのソースから直接特徴を抽出することで、より優れた細部保持が達成され、LPIPSスコアは0.143となる。
- 空間的モードが顕著に画像品質を向上させ、ソース画像を入力とした場合、LPIPSを0.151から0.139に低下させる。
- 従来手法と比較して、手やゆるい衣類のアーチファクトが低減されるが、長髪および暗い肌の個体ではデータセットバイアスのため課題が残る。
- モデルはDeepFashionデータセットのバイアスを引き継ぎ、暗い肌の個体やカールヘアの被験者に対しては性能が劣る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。