Skip to main content
QUICK REVIEW

[論文レビュー] MUST-GAN: Multi-level Statistics Transfer for Self-driven Person Image Generation

Tianxiang Ma, Bo Peng|arXiv (Cornell University)|Nov 18, 2020
Generative Adversarial Networks and Image Synthesis参考文献 43被引用数 4
ひとこと要約

本稿では、ペaired学習データが不要な自己駆動型人物画像生成モデルであるMUST-GANを提案する。このモデルは、ソース画像からの多段階の外見統計を分離・転送可能であり、アテンション機構とポーズガイドド生成を活用することで、柔軟なポーズおよび衣類スタイル転送を実現し、DeepFashionでは最先端の性能を達成するとともに、実世界の画像に対しても頑健な結果を示す。

ABSTRACT

Pose-guided person image generation usually involves using paired source-target images to supervise the training, which significantly increases the data preparation effort and limits the application of the models. To deal with this problem, we propose a novel multi-level statistics transfer model, which disentangles and transfers multi-level appearance features from person images and merges them with pose features to reconstruct the source person images themselves. So that the source images can be used as supervision for self-driven person image generation. Specifically, our model extracts multi-level features from the appearance encoder and learns the optimal appearance representation through attention mechanism and attributes statistics. Then we transfer them to a pose-guided generator for re-fusion of appearance and pose. Our approach allows for flexible manipulation of person appearance and pose properties to perform pose transfer and clothes style transfer tasks. Experimental results on the DeepFashion dataset demonstrate our method's superiority compared with state-of-the-art supervised and unsupervised methods. In addition, our approach also performs well in the wild.

研究の動機と目的

  • 教師付き人物画像生成における高いデータアノテーションコストを低減すること。これはペアドソース・ターゲット画像に依存するためである。
  • ソース画像を再構成のための監視として用いることで、ペアドデータが不要な自己駆動型学習を可能にすること。
  • 顔貌およびポーズを保持しながら、色・テクスチャ・スタイルなどの多段階の外見特徴を分離・転送すること。
  • ポーズと外見属性の柔軟で制御可能な操作を可能とし、ポーズ転送や衣類スタイル転送などのタスクを支援すること。
  • 収集済みデータセットにとどまらず、実世界(ワイルド)の設定においてもモデルの一般化性能を評価すること。

提案手法

  • 人物画像から多段階特徴を抽出するために、セマンティックセグメンテーションを用いた外見エンコーダを採用する。
  • 多段階特徴マップにおける重要なチャネルを重みづけするために、チャネルアテンション機構を採用する。
  • 全結合ネットワークによる統計マッチングを用いて、生成器へ外見統計を転送する。
  • アドアプティブインスタンス正規化(AdaIN)と学習可能なスキップ接続を組み合わせた、多段階統計マッチングネットワークを導入し、ポーズガイドド画像生成を実現する。
  • ポーズ画像とポーズ接続マップを処理するためのポーズエンコーダを用いることで、空間的ガイダンスを提供する。
  • ペアドデータが不要なエンドツーエンドの学習を、ソース画像のみを監視信号として用いて実施する。

実験結果

リサーチクエスチョン

  • RQ1ペアドソース・ターゲット画像がなくても、高い画像品質を維持したまま人物画像生成モデルを学習可能か?
  • RQ2多段階の外見統計は、どれほど効果的に分離・転送可能か?また、リアルな画像合成にどの程度寄与するか?
  • RQ3モデルは、ポーズと外見属性を独立して操作できる程度まで到達するか?
  • RQ4実世界の制約のない(ワイルドな)画像において、モデルの一般化性能はどの程度高いか?
  • RQ5モデルは、ポーズ転送および衣類スタイル転送の両タスクで最先端の性能を達成できるか?

主な発見

  • DeepFashionデータセット上での評価において、本手法はインceptionスコア3.692、SSIM 0.742、FID 15.902、LPIPS 0.2412を達成し、既存の教師付き手法を上回った。
  • アブレーションスタディの結果、MUSTモジュールを削除するとFIDは21.928に上昇し、LPIPSは0.2840に増加するなど、MUSTモジュールの重要性が確認された。
  • チャネルアテンション機構の導入により、SSIMは0.011向上し、FIDは1.621低下した。これは、特徴の重みづけにおける有効性を示している。
  • ポーズ接続マップ(PCM)を導入した場合、PCMなしの完全モデルと比較して、FIDは0.965改善され、LPIPSは0.0102改善された。
  • 本モデルは、顔貌を保持したまま、同時にポーズと衣類スタイルの転送を成功裏に実行した。
  • ワイルドな評価では、複雑な背景を有するWeb由来の画像に対しても、色およびテクスチャの忠実度が高く維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。