Skip to main content
QUICK REVIEW

[論文レビュー] Towards Disentangled Representations for Human Retargeting by Multi-view Learning

Chao Yang, Xiaofeng Liu|arXiv (Cornell University)|Dec 12, 2019
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本論文は、画像、キーポints、ポーズを補助的ビューとして活用することで、顔やボディのリターゲティングタスクにおいて、分離可能でアイデンティティに依存しない表現を学習する、マルチビュー条件付き変分オートエンコーダー(CVAE)を提案する。これらのビュー間で潜在表現の一貫性を強制することにより、表現やポーズの意味論を保持しながら、アイデンティティ固有の属性を排除し、顔やボディのリターゲティングタスクにおいて、表現の保存性と再構成品質の面で最先端の性能を達成した。

ABSTRACT

We study the problem of learning disentangled representations for data across multiple domains and its applications in human retargeting. Our goal is to map an input image to an identity-invariant latent representation that captures intrinsic factors such as expressions and poses. To this end, we present a novel multi-view learning approach that leverages various data sources such as images, keypoints, and poses. Our model consists of multiple id-conditioned VAEs for different views of the data. During training, we encourage the latent embeddings to be consistent across these views. Our observation is that auxiliary data like keypoints and poses contain critical, id-agnostic semantic information, and it is easier to train a disentangling CVAE on these simpler views to separate such semantics from other id-specific attributes. We show that training multi-view CVAEs and encourage latent-consistency guides the image encoding to preserve the semantics of expressions and poses, leading to improved disentangled representations and better human retargeting results.

研究の動機と目的

  • 画像、キーポイント、ポーズなどの非ペairedなマルチソースデータから、分離可能でアイデンティティに依存しない表現を学ぶこと。
  • アイデンティティの入れ替えにおいても、表情やポーズといった内在的属性を保存することで、人間のリターゲティングを向上させること。
  • 従来の手法が敵対的正則化の下で意味的コンテンツを失うという限界を是正すること。
  • キーポイントなどの補助的ビューが、ドメイン不変の意味論をより効果的に符号化することで、分離の簡素化に寄与することを示すこと。
  • 共有された潜在空間を用いて、1人のユーザーの顔や目の動きを別のユーザーにリアルタイムに転送することで、VRにおけるリアルタイム3Dアバター駆動を可能にすること。

提案手法

  • 画像、2Dキーポイント、3Dポーズといった異なるデータビューごとに、アイデンティティ条件付きのVAEを学習し、それぞれがドメイン不変の意味論を符号化する。
  • 対照的損失を用いて、これらのビュー間の潜在表現の距離を最小化することで、潜在表現の一貫性を強制する。
  • アイデンティティラベルを条件とする条件付きVAEを用い、顔の表情やポーズといった共有された意味的要因からアイデンティティ固有の属性を分離する。
  • 検出されたキーポイントなどの補助的データを、簡素化されながらも意味論的に豊かなビューとして活用し、分離を支援し、曖昧さを低減する。
  • 分離された潜在空間に回帰ヘッドを統合し、符号化された特徴量を3Dアバターのパラメータにマッピングすることで、リアルタイムVRアプリケーションに対応する。
  • 画像再構成とドメイン変換品質の向上のため、サイクル整合性損失とアイデンティティ分類損失を適用する。

実験結果

リサーチクエスチョン

  • RQ1キーポイントやポーズといった補助的データを用いたマルチビュー学習は、画像表現におけるアイデンティティに依存しない意味論の分離を改善できるか?
  • RQ2複数のビュー間で潜在表現の一貫性を強制することで、アイデンティティの移行時に表情やポーズの保存性が向上するか?
  • RQ3提案手法のマルチビューCVAEは、CycleGAN や UFDN といったベースライン手法と比較して、意味的忠実度と再構成品質の面で優れているか?
  • RQ4非ペアのデータから学習した分離可能な表現は、リアルタイムVRアプリケーションにおける3Dアバター駆動に効果的に応用できるか?
  • RQ5潜在空間における敵対的正則化は、顔の表情のようなドメイン内意味的コンテンツの保存性をどの程度損なうか?

主な発見

  • 提案手法は、真値の表情ラベルと比較して、最小の ℓ₂ 距離(0.76)を達成し、CycleGAN(0.82)、UFDN(2.21)、画像ベースのCVAEベースライン(1.15)を上回った。
  • t-SNE可視化により、モデルの潜在表現が表情ごとにクラスタリングされ、アイデンティティに対して不変であることが確認された。一方、CVAEベースラインは明確に表情を分離できなかった。
  • 再構成誤差(AE)が 0.51、分類誤差が 0.36 と、高い画像品質と正確なアイデンティティ転送を示した。
  • 共有されたアイデンティティに依存しない潜在空間を用いて、1人のユーザーの顔や目の動きを別のユーザーにリアルタイムに転送することで、VRにおけるリアルタイム3Dアバター駆動を成功裏に実現した。
  • マルチビュー監視の導入により、意味的保存性が顕著に向上し、ℓ₂ 距離が低く抑えられ、表情のt-SNEクラスタリングも明確になった。
  • 潜在空間における敵対的正則化は、特に表情の意味的忠実度を損なうことが判明し、マルチビュー一貫性損失の有効性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。