Skip to main content
QUICK REVIEW

[論文レビュー] All-In-One: Facial Expression Transfer, Editing and Recognition Using A Single Network

Kamran Ali, Charles E. Hughes|arXiv (Cornell University)|Nov 16, 2019
Face recognition and analysis参考文献 35被引用数 7
ひとこと要約

本稿では、1つのアーキテクチャで顔の表情移動、編集、認識を統合的に実行する統合的生成対抗ネットワーク、TER-GANを提案する。ソース画像とターゲット画像からそれぞれ表情特徴とアイデンティティ特徴を分離する2つの専用エンコーダを用い、それらをデコーダで結合することで、写真のようにリアルな合成を実現する。この手法により、顔のランドマークやアクションユニットなどの補助的監視を必要とせず、3つのタスクすべてで最先端の性能を達成する。

ABSTRACT

In this paper, we present a unified architecture known as Transfer-Editing and Recognition Generative Adversarial Network (TER-GAN) which can be used: 1. to transfer facial expressions from one identity to another identity, known as Facial Expression Transfer (FET), 2. to transform the expression of a given image to a target expression, while preserving the identity of the image, known as Facial Expression Editing (FEE), and 3. to recognize the facial expression of a face image, known as Facial Expression Recognition (FER). In TER-GAN, we combine the capabilities of generative models to generate synthetic images, while learning important information about the input images during the reconstruction process. More specifically, two encoders are used in TER-GAN to encode identity and expression information from two input images, and a synthetic expression image is generated by the decoder part of TER-GAN. To improve the feature disentanglement and extraction process, we also introduce a novel expression consistency loss and an identity consistency loss which exploit extra expression and identity information from generated images. Experimental results show that the proposed method can be used for efficient facial expression transfer, facial expression editing and facial expression recognition. In order to evaluate the proposed technique and to compare our results with state-of-the-art methods, we have used the Oulu-CASIA dataset for our experiments.

研究の動機と目的

  • 顔の表情移動や編集におけるアイデンティティ漏洩の課題に対処すること。これは、表情とアイデンティティの特徴が適切に分離されていない場合に生じる。
  • 表情合成における補助的監視(顔のランドマーク、アクションユニット、ワンホットコードなど)を排除すること。
  • 1つのモデルが3つの関連タスク(表情移動、表情編集、顔の表情認識)を実行できることを実現すること。
  • 訓練中に合成画像を活用する新しい整合性損失により、特徴の分離を向上させること。
  • 分離された表情表現が、未学習のアイデンティティに対して、頑健な顔の表情認識に直接利用可能であることを示すこと。

提案手法

  • モデルは2つの別々のエンコーダを用いる:$G_{es}$ はソース画像から表情特徴を抽出し、$G_{et}$ はターゲット画像からアイデンティティ特徴を抽出する。
  • 抽出された表情特徴とアイデンティティ特徴が連結され、デコーダ $G_{de}$ に渡され、ソースの表情とターゲットのアイデンティティを持つ合成画像が生成される。
  • 各エンコーダの出力に、対抗的整合性損失を導入する:表情整合性損失とアイデンティティ整合性損失であり、特徴品質の向上を図るために合成画像を活用する。
  • 生成器は、生成画像のリアルさを保証するためのディスクラミネーターを用いたGANフレームワークで、エンドツーエンドに訓練される。
  • 顔の表情認識のため、$G_{es}$ エンコーダを分離し、Oulu-CASIAデータセット上で浅い分類器でファインチューニングする。
  • t-SNE可視化を用いて、表情特徴がアイデンティティ表現から効果的に分離されているかを定性的に検証する。

実験結果

リサーチクエスチョン

  • RQ11つのディープラーニングアーキテクチャが、補助的監視を一切用いずに、顔の表情移動、編集、認識を効果的に実行できるか?
  • RQ2ワンホットコードやアクションユニットに依存せずに、統合モデルがアイデンティティと表情特徴をどれほど効果的に分離できるか?
  • RQ3対抗的整合性損失の使用が、抽出された表情およびアイデンティティ表現の品質と分離性を向上させるか?
  • RQ4エンコーダから抽出された分離された表情表現が、未学習のアイデンティティに対して顔の表情認識に効果的に利用できるか?
  • RQ5視覚的リアリズムと認識精度の観点から、最先端手法と比較して、このモデルはどの程度優れているか?

主な発見

  • TER-GANは、Oulu-CASIAデータセットにおける顔の表情認識で、GANベースおよびCNNベースの最先端手法を上回る最先端の性能を達成した。
  • 表情特徴のt-SNE可視化において、基本的な顔の表情に対応する6つの明確なクラスタが観察され、アイデンティティ情報からの有効な分離が確認された。
  • 表情移動や編集の過程で、ターゲット画像のアイデンティティが効果的に保持されており、従来手法と比較して顕著なアイデンティティ漏洩が抑制された。
  • $G_{es}$ から抽出された分離された表情表現は、動画の時間的情報を用いる手法を上回る高い認識精度を達成し、顔の表情認識に効果的に利用可能であった。
  • 合成画像と整合性損失の使用により、より優れたクラスタリングと再構成忠実度が示され、特徴品質の向上が裏付けられた。
  • 変動正則化技術を回避することで計算複雑性を低減しながらも、高品質でアーチファクトのない合成画像を生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。