Skip to main content
QUICK REVIEW

[論文レビュー] Photorealistic Facial Expression Synthesis by the Conditional Difference Adversarial Autoencoder

Yuqian Zhou, Bertram E. Shi|arXiv (Cornell University)|Aug 30, 2017
Generative Adversarial Networks and Image Synthesis参考文献 19被引用数 16
ひとこと要約

本稿では、同一個人の表情間の低レベル特徴の差分を学習することにより、1枚の入力画像から写真のようにリアルな表情を合成する、新たな生成モデルである条件付き差分 adversarial autoencoder (CDAAE) を提案する。顔の表情転送において、特に小規模なデータセットでも顔の同一性の保持が優れており、忠実度と同一性・表情要因の分離性において、先行手法を上回る性能を発揮する。

ABSTRACT

Photorealistic facial expression synthesis from single face image can be widely applied to face recognition, data augmentation for emotion recognition or entertainment. This problem is challenging, in part due to a paucity of labeled facial expression data, making it difficult for algorithms to disambiguate changes due to identity and changes due to expression. In this paper, we propose the conditional difference adversarial autoencoder, CDAAE, for facial expression synthesis. The CDAAE takes a facial image of a previously unseen person and generates an image of that human face with a target emotion or facial action unit label. The CDAAE adds a feedforward path to an autoencoder structure connecting low level features at the encoder to features at the corresponding level at the decoder. It handles the problem of disambiguating changes due to identity and changes due to facial expression by learning to generate the difference between low-level features of images of the same person but with different facial expressions. The CDAAE structure can be used to generate novel expressions by combining and interpolating between facial expressions/action units within the training set. Our experimental results demonstrate that the CDAAE can preserve identity information when generating facial expression for unseen subjects more faithfully than previous approaches. This is especially advantageous when training with small databases.

研究の動機と目的

  • 1枚の画像から写真のようにリアルな表情を生成する際の顔の同一性を保持する課題に対処すること。
  • 大規模なラベル付き表情データセットが存在しない状況下で、顔の同一性固有の特徴と表情固有の変化を明確に分離すること。
  • 学習した表情の差分の補間と組み合わせることで、新たな表情の生成を可能とすること。
  • 顔の表情変動を特徴の差分として明示的にモデル化することで、小規模な学習データベースでも性能を向上させること。
  • 条件付き生成モデルを用いて、高忠実度で顔の同一性を保持する表情合成を実現すること。

提案手法

  • CDAAEは、エンコーダーとデコーダーの各対応する特徴レベルに、エンコーダーからデコーダーへのフィードフォワードスキップ接続を導入し、顔の同一性に関連する特徴の直接伝搬を可能にする。
  • 同じ人物の表情間の低レベル特徴の差分を学習しつつ、顔の画像を再構築するオートエンコーダーを訓練する。
  • 本モデルは、本物の画像と生成された画像を区別することで、写真のようにリアルな出力を生成するための条件付き adversarial 損失を用いる。
  • ネットワークは、ターゲットの表情または顔の行動単位(FAU)ラベルに条件付けられており、制御された表情の合成を可能にする。
  • モデルは、全体の画像再構築ではなく、特徴の差分に注目することで、顔の同一性を保持しつつ、表情関連の変化のみを生成する。
  • 学習した表情差分の補間により、トレーニングセットに存在しない、現実的で新しい中間の表情が合成可能となる。

実験結果

リサーチクエスチョン

  • RQ1深層生成モデルは、1枚の画像から顔の同一性を保持した写真のようにリアルな表情を合成できるか?
  • RQ2限られた学習データのもとで、モデルは顔の同一性固有の特徴と表情固有の特徴をどれほど正確に分離できるか?
  • RQ3学習した表情差分の補間によって、新たな顔の表情を生成できるか?
  • RQ4標準的なオートエンコーダーと比較して、条件付き差分オートエンコーダーの枠組みは、顔の同一性保持と表情の忠実度において優れているか?
  • RQ5CDAAEは、既存の手法と比較して、小規模なデータセットでも顔の表情合成において優れた性能を発揮するか?

主な発見

  • CDAAEは、未学習の被験者に対して表情を生成する際、従来手法よりも顔の同一性保持が優れており、知覚的品質と同一性の一貫性において優れた性能を発揮する。
  • 本モデルは、小規模なデータセットで学習しても、写真のようにリアルな顔の表情を生成でき、強力な一般化能力を示す。
  • 条件付き差分学習の使用により、潜在空間における顔の同一性と表情要因の正確な分離が可能になる。
  • 学習した表情差分の補間により、トレーニングセットに存在しない妥当な中間の顔の表情が生成される。
  • 条件付き adversarial 学習部は、生成された顔の画像のリアルさを顕著に向上させる。
  • モデルのスキップ接続は、特徴の忠実度を向上させ、表情転送中の劣化を低減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。