Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Dual-task Correlation for Pose Guided Person Image Generation

Pengze Zhang, Lingxiao Yang|arXiv (Cornell University)|Mar 6, 2022
Human Pose and Action Recognition被引用数 5
ひとこと要約

本稿では、ソースからターゲットへのポーズ変換のための補助学習信号としてソースからソースへの再構成タスクを導入することで、ポーズガイドド・ペルソン・イメージ生成のためのデュアルタスク・ポーズ変換器ネットワーク(DPTN)を提案する。ソースからターゲットへのブランチとソースからソースへのブランチの間で重みを共有し、二重タスク相関を活用するポーズ変換器モジュール(PTM)を用いることで、DPTNはテクスチャ転送を向上させ、979万パラメータでより現実的な画像を生成し、PSNRおよびLPIPSの点でSOTAを上回る性能を発揮する。

ABSTRACT

Pose Guided Person Image Generation (PGPIG) is the task of transforming a person image from the source pose to a given target pose. Most of the existing methods only focus on the ill-posed source-to-target task and fail to capture reasonable texture mapping. To address this problem, we propose a novel Dual-task Pose Transformer Network (DPTN), which introduces an auxiliary task (i.e., source-to-source task) and exploits the dual-task correlation to promote the performance of PGPIG. The DPTN is of a Siamese structure, containing a source-to-source self-reconstruction branch, and a transformation branch for source-to-target generation. By sharing partial weights between them, the knowledge learned by the source-to-source task can effectively assist the source-to-target learning. Furthermore, we bridge the two branches with a proposed Pose Transformer Module (PTM) to adaptively explore the correlation between features from dual tasks. Such correlation can establish the fine-grained mapping of all the pixels between the sources and the targets, and promote the source texture transmission to enhance the details of the generated target images. Extensive experiments show that our DPTN outperforms state-of-the-arts in terms of both PSNR and LPIPS. In addition, our DPTN only contains 9.79 million parameters, which is significantly smaller than other approaches. Our code is available at: https://github.com/PangzeCheung/Dual-task-Pose-Transformer-Network.

研究の動機と目的

  • 人物画像生成におけるソースからターゲットへのポーズ変換の不適切な定式化(ill-posed nature)に対処すること。これは、しばしば現実的でないテクスチャやアーティファクトを引き起こす。
  • 大きなポーズ変化におけるテクスチャマッピングの忠実性を向上させること。既存の手法では、ソースの外見的詳細を保持できないことがある。
  • ソースからターゲットの生成器の訓練を安定化させること。ソースからソースへの自己再構成タスク(補助的)を導入し、重みを共有することで実現する。
  • 二重タスクの特徴間の細粒度相関を明示的にモデル化することで、ソースからターゲットブランチにおける特徴の精練を向上させること。
  • 従来の手法よりも大幅に少ないパラメータで、かつ効果的な軽量アーキテクチャを開発し、SOTAの性能を達成すること。

提案手法

  • ソースからソースへの自己再構成ブランチと、ソースからターゲットへの変換ブランチを持つ、シアンズ型のDPTNを提案する。
  • 二つのブランチ間で部分的な重みを共有することで、より簡単なソースからソースのタスクから、より難しいソースからターゲットのタスクへの知識蒸留を可能にする。
  • クロスタスク特徴相関をモデル化するためのポーズ変換器モジュール(PTM)を設計。PTMにはコンテキスト拡張ブロック(CABs)とテクスチャ転送ブロック(TTBs)を含む。
  • PTMでマルチヘッドクロスアテンション(MHCA)を用い、ピクセルレベルでソースからソースブランチとソースからターゲットブランチの特徴をアライメントする。
  • PTMで精錬された特徴をソースからターゲットブランチに統合し、テクスチャの詳細生成を向上させる。
  • 再構成用のL1損失と現実性を評価するための知覚的損失を別々の損失関数として用い、両ブランチを同時に最適化することで、ネットワーク全体を訓練する。
Figure 1 : Visual comparison of our method with other approaches, including vanilla CNN based [ 22 ] , attention based [ 45 ] , optical flow based [ 24 ] , and parsing map based [ 21 ] method. Compared with other methods, our model can generate more realistic images.
Figure 1 : Visual comparison of our method with other approaches, including vanilla CNN based [ 22 ] , attention based [ 45 ] , optical flow based [ 24 ] , and parsing map based [ 21 ] method. Compared with other methods, our model can generate more realistic images.

実験結果

リサーチクエスチョン

  • RQ1ソースからソースへの自己再構成タスクを補助学習信号として導入することで、ポーズガイドド・ペルソン・イメージ生成の性能と安定性が向上するか?
  • RQ2二重タスクの特徴間の細粒度相関をモデル化することで、生成画像におけるテクスチャ転送と詳細の保持がどのように向上するか?
  • RQ3デュアルタスク学習は、ソースからターゲットの生成タスクにおける訓練の安定性をどの程度向上させ、モード崩壊を防止するか?
  • RQ4わずか979万パラメータの軽量アーキテクチャが、定量的および定性的な指標において、より大きなSOTAモデルを上回る性能を発揮できるか?
  • RQ5提案されたポーズ変換器モジュール(PTM)は、幾何学的整合性を保ちながら、テクスチャをソースからターゲットに効果的に伝達できるか?

主な発見

  • DPTNの完全モデルは、DeepFashionデータセットでPSNR 19.1492、LPIPS 0.1957を達成し、すべてのアブレーションバリアントおよびSOTA手法を上回る性能を発揮した。
  • アブレーションスタディの結果、デュアルタスク学習(w/o DTL)を削除すると、訓練が不安定になり、重度のアーティファクトが生じ、これが訓練安定性におけるその重要性を裏付けた。
  • PTMを削除した場合、テクスチャマッピングが不十分になるため、画像がぼやける。これは、PTMがソース外見の詳細を転送する上で極めて重要な役割を果たしていることを示している。
  • CABsを削除したモデルは、ソースからソースの知識を効果的に統合できず、生成画像に現実的でないパターンが現れた。
  • エンコーダーを削除したモデル(w/o En_s)は、細粒度のテクスチャの手がかりを失い、PTMにソースのテクスチャ情報を供給する重要性を証明した。
  • 完全モデルはDeepFashionでFIDスコア11.4664を達成し、学習曲線はデュアルタスク学習では継続的な改善が見られた一方、シングルタスク学習では130エポック目で崩壊した。
Figure 2 : Overview of our model. It contains a self-reconstruction branch for auxiliary source-to-source task, and a transformation branch for source-to-target task. These two branches share partial weights and are communicated by a pose transformer module.
Figure 2 : Overview of our model. It contains a self-reconstruction branch for auxiliary source-to-source task, and a transformation branch for source-to-target task. These two branches share partial weights and are communicated by a pose transformer module.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。