Skip to main content
QUICK REVIEW

[論文レビュー] Coordinate-based Texture Inpainting for Pose-Guided Image Generation

Artur Grigorev, Artem Sevastopolsky|arXiv (Cornell University)|Nov 28, 2018
Generative Adversarial Networks and Image Synthesis参考文献 40被引用数 9
ひとこと要約

本稿では、ポーズガイドドな人間画像生成のための座標ベースのテクスチャインpainting手法を提案する。深層ネットワークが各ボディ表面テクセルに対して、高周波成分の詳細を保持するように元画像の座標を予測する。本手法は、学習された対応関係と可変スキップ接続を活用した完全畳み込み型フレームワークにより、ポーズガイドドな画像合成、衣類転送、顔再構築の分野で最先端の結果を達成する。

ABSTRACT

We present a new deep learning approach to pose-guided resynthesis of human photographs. At the heart of the new approach is the estimation of the complete body surface texture based on a single photograph. Since the input photograph always observes only a part of the surface, we suggest a new inpainting method that completes the texture of the human body. Rather than working directly with colors of texture elements, the inpainting network estimates an appropriate source location in the input image for each element of the body surface. This correspondence field between the input image and the texture is then further warped into the target image coordinate frame based on the desired pose, effectively establishing the correspondence between the source and the target view even when the pose change is drastic. The final convolutional network then uses the established correspondence and all other available information to synthesize the output image. A fully-convolutional architecture with deformable skip connections guided by the estimated correspondence field is used. We show state-of-the-art result for pose-guided image synthesis. Additionally, we demonstrate the performance of our system for garment transfer and pose-guided face resynthesis.

研究の動機と目的

  • 単一の入力写真から、新しいポーズにおける高品質で詳細な人間の画像を生成する課題に対処すること。
  • 大きなポーズ変化下で一般的に見られるぼやけやテクスチャ詳細の損失を克服すること。
  • 人間の体の対称性と幾何的事前知識を活用して、欠損したテクスチャ領域を効果的に補完する手法を開発すること。
  • 仮想試着や拡張現実の応用において、ポーズ間での外観を正確に転送することで、現実的な画像合成を可能にすること。

提案手法

  • 本手法は、各テクセルに対して直接色を予測するのではなく、元画像内の対応するピクセル座標を予測する座標ベースのインpaintingネットワークを用いる。
  • この対応フィールドは深層畳み込みネットワークを用いて推定され、その後、ターゲットポーズのDensePose記述子を用いてターゲットポーズの座標フレームに変形される。
  • 最終的な画像合成は、推定された対応フィールドによってガイドされた可変スキップ接続を備えた完全畳み込み型エンコーダ・デコーダネットワークによって実行される。
  • ネットワークは、元画像と変形された元座標を入力とし、ターゲットポーズに条件づけられた新しいビューを出力するように、エンドツーエンドで学習される。
  • 3Dボディジオメトリとテクスチャマッピングをモデル化するため、SMPLとDensePose表現を用いることで、ポーズ間で一貫した変形が可能になる。
  • アブレーションスタディにより、座標ベースのインpaintingと可変スキップ接続の重要性が確認された。

実験結果

リサーチクエスチョン

  • RQ1直接RGBインpaintingと比較して、座標ベースのテクスチャインpaintingは、ポーズガイドドな画像合成の視覚的品質を顕著に向上させることができるか?
  • RQ2大きなポーズ変化や部分的観測下でも、本手法は高周波成分のテクスチャ詳細をどれほど効果的に保持できるか?
  • RQ3学習された対応フィールドによってガイドされた可変スキップ接続は、生成画像の現実性をどの程度向上させるか?
  • RQ4同じフレームワークを、衣類転送や野生の顔再構築などの他のタスクに一般化できるか?
  • RQ5定量的指標とユーザーパーセプションの両面で、本座標ベースのアプローチは、既存の最先端手法を上回る性能を示すか?

主な発見

  • Deep Fashionデータセットでは、本手法がSSIM 0.791、MS-SSIM 0.810、IS 4.46、LPIPS 0.169を達成し、先行研究の最先端手法を上回った。
  • アブレーションスタディにより、可変スキップ接続を削除するとISが3.23に低下し、LPIPSが0.198に上昇することが示され、その重要性が裏付けられた。
  • 座標ベースのインpainting手法は、RGBインpaintingと比較してLPIPSスコアが0.029低く(0.169 vs. 0.198)あり、より優れた知覚的品質を示した。
  • 300-VWデータセットにおける顔再構築では、SSIM 0.613、MS-SSIM 0.764を達成し、野生の顔画像への汎用性が強く示された。
  • ユーザースタディにより、本手法が現実性とテクスチャ詳細の保持の点で、既存手法を上回ることが確認された。
  • 本手法は、現実的な衣類転送を可能にする仮想試着にも成功し、ファッションおよびAR分野における実用的応用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。