[論文レビュー] Dense Pose Transfer
本稿では、ソース画像から人物の外見をポーズドナーによって制御された新しいポーズに転送するためのニューラル合成フレームワーク、Dense Pose Transferを提案する。表面ベースのワープモジュールとインpaintingネットワーク、および adversarial、perceptual、reconstruction損失を用いてエンドツーエンドで訓練された条件付き生成モデルを組み合わせることで、DeepFashionおよびMVCデータセットにおいてポーズ転送の分野で最先端の結果を達成し、キーポoinトやマスクベースのベースラインを上回った。
In this work we integrate ideas from surface-based modeling with neural synthesis: we propose a combination of surface-based pose estimation and deep generative models that allows us to perform accurate pose transfer, i.e. synthesize a new image of a person based on a single image of that person and the image of a pose donor. We use a dense pose estimation system that maps pixels from both images to a common surface-based coordinate system, allowing the two images to be brought in correspondence with each other. We inpaint and refine the source image intensities in the surface coordinate system, prior to warping them onto the target pose. These predictions are fused with those of a convolutional predictive module through a neural synthesis module allowing for training the whole pipeline jointly end-to-end, optimizing a combination of adversarial and perceptual losses. We show that dense pose estimation is a substantially more powerful conditioning input than landmark-, or mask-based alternatives, and report systematic improvements over state of the art generators on DeepFashion and MVC datasets.
研究の動機と目的
- スパarsなまたは粗い条件付き信号の代わりに、密な人間の身体表面表現を用いることで、ポーズ転送の品質を向上させること。
- 単一のソース画像とポーズドナー画像のみを用いて、人物の新しいポーズにおける写真同等の画像合成を可能にすること。
- 幾何学的ワープ、インpainting、生成合成を同時に最適化するエンドツーエンドで学習可能なフレームワークを開発すること。
- 密なポーズ推定がランドマークやセグメンテーションマップよりも優れた条件付き信号であることを実証すること。
提案手法
- 本手法は、ソースおよびターゲット画像を共通の3次元表面ベースのUV座標系にマップするDensePoseを用い、ポーズ間でピクセル単位の対応を可能にする。
- UV空間で動作するU-Netベースのインpaintingネットワークを用いて、欠損または隠蔽されたテクスチャをワープの前に再構築する。
- 別個のフォワード予測モジュールが、ポーズと外見特徴に条件づけられた粗い画像合成を生成する。
- ワープ(インpaintingベース)モジュールと予測モジュールの出力を、組み合わせた adversarial、perceptual、L1再構成損失で訓練されたブレンドネットワークにより統合する。
- L1、perceptual、スタイル、GANベースの損失を含む複合損失関数を用いて、エンドツーエンドでパイプライン全体を訓練し、リアリズムと構造の質を向上させる。
- フレームワークはSMPLベースのボディモデリングとDensePoseを用い、幾何的整合性を保証するとともに、ポーズ間での正確なテクスチャ転送を可能にする。
実験結果
リサーチクエスチョン
- RQ1密な人間の身体表面表現は、スパarsまたは粗い監視に比べて、画像ベースのポーズ転送の品質と制御性を顕著に向上させるか?
- RQ2UV空間におけるインpaintingの組み込みは、ポーズ転送におけるリアリズムの向上とアーティファクトの低減にどのように寄与するか?
- RQ3L1、perceptual、スタイル、adversarial損失の各成分が最終的な画像品質に果たす相対的寄与度は何か?
- RQ4幾何学的ワープとデータ駆動型合成を組み合わせた二ストリームアーキテクチャは、単一ストリームの生成モデルに比べてポーズ転送で優れた性能を示すか?
- RQ5提案手法は、明示的な3次元監視やテクスチャマップを必要とせず、多様なデータセットに一般化可能であり、最先端の性能を達成できるか?
主な発見
- L1、perceptual、スタイル、GAN損失をすべて含む完全なモデルは、DeepFashionデータセットでFIDスコア3.61を達成し、優れた知覚的品質を示した。
- アブレーションスタディでは、ワープストリームにインpaintingモジュールを追加することで、SSIMが0.789から0.796に、MS-SSIMが0.814から0.823に向上した。これは、遮蔽領域の処理における有効性を示している。
- perceptual損失は構造的忠実性と最も相関が高く、スタイル損失はテクスチャのシャープネスを向上させたが、均一な領域ではアーティファクトを誘発した。
- 定量的指標(SSIM、MS-SSIM、IS)および定性的な結果において、キーポイントベースおよびセグメンテーションベースのベースラインを上回った。特に、複雑なボディシェイプや衣類のディテールの処理において顕著な優位性を示した。
- ブレンドモジュールは、予測ストリームとワープストリームの相補的特徴を効果的に統合し、テクスチャ境界における目立つアーティファクトを低減した。
- フレームワークは、DeepFashionおよびMVCデータセットの両方で最先端の性能を達成し、密なポーズ推定が条件付き信号として優れていることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。