[論文レビュー] Dense Intrinsic Appearance Flow for Human Pose Transfer
本稿では、写実的で詳細な再現性を向上させるために、密な内部3次元外観フローを用いた新しい人間ポーズ転送手法を提案する。2次元ポーズから3次元モデルフィッティングにより3次元フローを合成し、前向きネットワークが効率的なピクセル単位のワープを実行するための3次元外観および可視性マップを回帰する。DeepFashionおよびMarket-1501で最先端の結果を達成し、画像品質と属性の保持が優れている。
We present a novel approach for the task of human pose transfer, which aims at synthesizing a new image of a person from an input image of that person and a target pose. We address the issues of limited correspondences identified between keypoints only and invisible pixels due to self-occlusion. Unlike existing methods, we propose to estimate dense and intrinsic 3D appearance flow to better guide the transfer of pixels between poses. In particular, we wish to generate the 3D flow from just the reference and target poses. Training a network for this purpose is non-trivial, especially when the annotations for 3D appearance flow are scarce by nature. We address this problem through a flow synthesis stage. This is achieved by fitting a 3D model to the given pose pair and project them back to the 2D plane to compute the dense appearance flow for training. The synthesized ground-truths are then used to train a feedforward network for efficient mapping from the input and target skeleton poses to the 3D appearance flow. With the appearance flow, we perform feature warping on the input image and generate a photorealistic image of the target pose. Extensive results on DeepFashion and Market-1501 datasets demonstrate the effectiveness of our approach over existing methods. Our code is available at http://mmlab.ie.cuhk.edu.hk/projects/pose-transfer
研究の動機と目的
- テスト時に明示的な3次元モデル推論を必要としない3次元幾何的推論を用いて、人間ポーズ転送における大規模な2次元外観変動および自己遮蔽を解決する。
- 細かい変形やテクスチャの詳細を捉えることができないキーポイントベースの表現の限界を克服する。
- 合成された3次元フローの監視を用いて、2次元ポーズペアから密な内部3次元ピクセル対応を学習することで、高精細な画像合成を実現する。
- ポーズ転送中に衣類のテクスチャや顔の特徴などの詳細な外観属性を保持する。
- 2次元ポーズから直接3次元外観フローと可視性マップを回帰する前向きネットワークを訓練することで、高速な推論を実現する。
提案手法
- 入力およびターゲットの2次元ポーズペアに3次元SMPLモデルをフィッティングし、3次元頂点対応を2次元画像平面に再投影することで、3次元外観フローの教師データを合成する。
- 2次元ポーズペアから密な3次元外観フローと可視性マップを回帰するための前向きU-Netベースの外観フローモジュールを訓練する。
- 予測された3次元外観フローを用いて、入力画像の特徴をワープし、可視性マップに従って自己遮蔽を処理するゲーミング機構を導入する。
- 画像およびポーズ特徴を別々に処理する二重エンコーダーU-Netジェネレータを統合し、特徴の融合後にワープとゲーテッド精錬を実行する。
- 再構成損失、 adversarial 損失、および知覚損失の組み合わせを用いて、写実的で構造的整合性の高い結果を得るために、エンドツーエンドでモデルを訓練する。
- 可視性マップを活用して、遮蔽領域の信頼性の低い特徴を抑制し、欠落した身体部位の hallucination を改善する。
実験結果
リサーチクエスチョン
- RQ12次元ポーズからの暗黙的な3次元幾何的推論は、人間ポーズ転送におけるピクセル単位の対応推定の正確性を向上させるか?
- RQ2合成された3次元モデルの投影から学習する密な3次元外観フローは、衣類テクスチャなどの細かい外観詳細の保持に寄与するか?
- RQ3合成された3次元フローのデータで訓練された前向きネットワークは、推論時に3次元モデルフィッティングを必要とせずに、実際のポーズ転送に一般化可能か?
- RQ4可視性マップは、遮蔽された身体部位の合成と全体的な画像品質にどのように寄与するか?
- RQ5提案されたフロー誘導ワープメカニズムは、従来のキーポイントベースや局所アフィン変換手法に比べてどの程度優れているか?
主な発見
- ユーザープ references スタディーにおいて、本手法は90.53%の勝率を達成し、SOTAベースライン [34] よりも顕著に優れた知覚的品質を示した。
- DeepFashion データセットでは、FashionIS スコアが4.898、k=20におけるAttrRec-kが49.044を記録し、優れた属性保持性を示した。
- アブレーションスタディーでは、ピクセルワープモジュールを削除するとFashionISが0.308ポイント、AttrRec-kが1.653ポイント低下し、詳細回復におけるその重要性が裏付けられた。
- 可視性マップを有するバージョンは、可視性なしのバージョンと比較して、k=20における属性リコールが2.448ポイント向上し、遮蔽処理におけるその重要性を確認した。
- 本手法では、偽物画像が本物と誤分類される割合を9.55%(ベースライン)から10.01%に低下させたが、本物画像が偽物と誤分類される率が上昇したため、より高い現実性を示した。
- 完全モデルは最高のSSIM(0.778)とIS(3.338)を達成し、アブレーションバージョンと比較して構造的および知覚的整合性の両方で向上を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。