Skip to main content
QUICK REVIEW

[論文レビュー] Facial Expression Recognition Using Disentangled Adversarial Learning

Kamran Ali, Charles E. Hughes|arXiv (Cornell University)|Sep 28, 2019
Face and Expression Recognition参考文献 27被引用数 8
ひとこと要約

本稿では、顔の表情表現をアイデンティティおよび照度要因から明示的に分離する、分離型敵対的学習フレームワークであるDE-GANを提案する。アイデンティティ条件付き復元を備えたエンコーダ・デコーダ型ジェネレータと、表情およびアイデンティティ分類を同時に行うマルチタスクディスクライマを用いることで、分離型で判別力のある表情特徴を学習し、CK+、MMI、Oulu-CASIAデータセットで最先端の性能を達成した。特にOulu-CASIAでは最大89.17%の精度を記録した。

ABSTRACT

The representation used for Facial Expression Recognition (FER) usually contain expression information along with other variations such as identity and illumination. In this paper, we propose a novel Disentangled Expression learning-Generative Adversarial Network (DE-GAN) to explicitly disentangle facial expression representation from identity information. In this learning by reconstruction method, facial expression representation is learned by reconstructing an expression image employing an encoder-decoder based generator. This expression representation is disentangled from identity component by explicitly providing the identity code to the decoder part of DE-GAN. The process of expression image reconstruction and disentangled expression representation learning is improved by performing expression and identity classification in the discriminator of DE-GAN. The disentangled facial expression representation is then used for facial expression recognition employing simple classifiers like SVM or MLP. The experiments are performed on publicly available and widely used face expression databases (CK+, MMI, Oulu-CASIA). The experimental results show that the proposed technique produces comparable results with state-of-the-art methods.

研究の動機と目的

  • 既存のFER手法がアイデンティティと表情の情報を混在させた表現を学習するという限界を解消し、未学習のアイデンティティに対する一般化性能を損なうのを防ぐ。
  • 異なるアイデンティティを持つ入力画像を再構成することで、分離型顔の表情表現を学習する生成モデルを開発する。
  • GANベースのフレームワークにマルチタスクディスクライマの監督を組み合わせることで、分離型特徴を抽出し、顔の表情認識性能を向上させる。
  • 学習済みの分離型表現を用いて、ソースのアイデンティティからターゲットのアイデンティティに表情を転送することで、顔の表情合成を可能にする。

提案手法

  • DE-GANフレームワークは、エンコーダ・デコーダ型ジェネレータアーキテクチャを採用しており、エンコーダが入力画像から分離型の表情表現を抽出する。
  • デコーダは、入力と同じ表情を持つが、異なるアイデンティティを持つ顔画像を再構成する。この際、アイデンティティコードが入力として与えられる。
  • ジェネレータは、本物か偽物の画像、およびアイデンティティと表情を分類するマルチタスクディスクライマをだませるように訓練される。
  • エンコーダから抽出された分離型表情表現は、SVMやMLPといったシンプルな分類器を用いた後続のFERタスクに使用される。
  • 訓練戦略では、後段のイテレーションにおいてジェネレータの更新頻度をディスクライマよりも高め、表情およびアイデンティティ分類の教師ラベルを活用する。
  • デコーダをアイデンティティコードで条件づける一方で、エンコーダからの表情表現のみを用いることで、表情とアイデンティティの成分を明示的に分離する。

実験結果

リサーチクエスチョン

  • RQ1敵対的学習を用いて、FERにおける顔の表情表現をアイデンティティおよび照度要因から明示的に分離可能か?
  • RQ2表情とアイデンティティを同時に分類するマルチタスクディスクライマは、分離型表情表現学習の質を向上させるか?
  • RQ3再構成ベースのGANを用いて抽出された分離型表情特徴は、標準的なFERベンチマークで最先端の性能を達成可能か?
  • RQ4データの完全性(被験者ごとの全表情カバレッジ)は、分離の質および認識精度にどのように影響するか?

主な発見

  • CK+データセットでは、7つの表情分類で97.28%の精度を達成し、CNNベースライン(90.34%)を上回った。
  • MMIデータセットでは、6つの表情分類で72.97%の精度を達成し、CNNベースライン(58.46%)を顕著に上回った。
  • Oulu-CASIAデータセットでは、6つの表情分類で89.17%の精度を達成し、被験者ごとの完全な表情カバレッジのおかげで、全データセット中最も高い性能を示した。
  • 結果から、DE-GANで学習された分離型表情特徴は非常に判別力が高く、特に各被験者に全表情が含まれる訓練データがある場合に、一般化性能が顕著に向上することが示された。
  • マルチタスクディスクライマは、表情およびアイデンティティ分類の共同監視により、画像再構成品質と分離の質の両方を顕著に向上させた。
  • 本手法は、入力と同じ表情を持つが異なるアイデンティティを持つ画像を生成することで、表情転送を実現し、生成能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。