Skip to main content
QUICK REVIEW

[論文レビュー] Pose-aware Adversarial Domain Adaptation for Personalized Facial Expression Recognition

Guang Liang, Shangfei Wang|arXiv (Cornell University)|Jul 12, 2020
Domain Adaptation and Few-Shot Learning参考文献 25被引用数 4
ひとこと要約

本論文は、ポーズおよび被験者(アイデンティティ)の変動に同時に対処することを目的とした、パーソナライズド顔の感情認識のための新しい非教師あり敵対的ドメイン適応手法を提案する。敵対的ドメイン適応、クロス敵対的特徴分離、再構成学習を統合することで、合成画像に依存せずにポーズおよびアイデンティティに頑健な感情特徴を学習し、SFEW や AffectNet を含む複数のベンチマークで最先端の性能を達成した。

ABSTRACT

Current facial expression recognition methods fail to simultaneously cope with pose and subject variations. In this paper, we propose a novel unsupervised adversarial domain adaptation method which can alleviate both variations at the same time. Specially, our method consists of three learning strategies: adversarial domain adaptation learning, cross adversarial feature learning, and reconstruction learning. The first aims to learn pose- and expression-related feature representations in the source domain and adapt both feature distributions to that of the target domain by imposing adversarial learning. By using personalized adversarial domain adaptation, this learning strategy can alleviate subject variations and exploit information from the source domain to help learning in the target domain. The second serves to perform feature disentanglement between pose- and expression-related feature representations by impulsing pose-related feature representations expression-undistinguished and the expression-related feature representations pose-undistinguished. The last can further boost feature learning by applying face image reconstructions so that the learned expression-related feature representations are more pose- and identity-robust. Experimental results on four benchmark datasets demonstrate the effectiveness of the proposed method.

研究の動機と目的

  • 顔の感情認識におけるポーズ変動と被験者(アイデンティティ)変動の二重的課題に対処すること。
  • ラベルなしのターゲットサンプルを必要とせずに、ラベル付きデータを含むソースドメインからラベルなしの新しい被験者を含むターゲットドメインへ知識を転送する非教師ありドメイン適応フレームワークを開発すること。
  • ポーズ関連および感情関連特徴を分離することで、ポーズおよびアイデンティティの変化に対して頑健性を向上させること。
  • 再構成学習を通じて特徴表現の質を向上させ、感情特徴がポーズおよびアイデンティティに対して不変であることを保証すること。
  • 複数ポーズ、屋外環境下の顔の感情認識設定において、既存手法を上回ること。

提案手法

  • ポーズおよび感情特徴のための別個のドメイン識別器を用いた敵対的ドメイン適応を採用し、ソースドメインとターゲットドメインの分布を一致させる。
  • クロス敵対的学習戦略を導入し、ポーズ識別器が感情特徴を区別できず、感情分類器がポーズ特徴を区別できないように訓練することで、特徴の分離を実現する。
  • 再構成学習を実施し、クロスドメインのポーズおよび感情特徴を組み合わせて元の顔画像を再構成することで、学習された表現の頑健性を強化する。
  • 敵対的ドメイン適応、クロス敵対的特徴学習、再構成学習の3つの学習戦略を統合的に訓練する。
  • ソースドメインおよびターゲットドメインのための別個のエンコーダを用い、ソースエンコーダはラベル付きデータで監視され、ターゲットエンコーダは敵対的目的で訓練される。
  • 再構成生成ネットワークを用いて、分離された特徴から顔画像を再構成し、学習された表現の質と分離度を強化する。

実験結果

リサーチクエスチョン

  • RQ1非教師ありドメイン適応フレームワークは、顔の感情認識におけるポーズおよび被験者変動によって引き起こされるドメインシフトを効果的に低減できるか?
  • RQ2ポーズおよび感情関連特徴をどのように分離すれば、ポーズおよびアイデンティティの変化に対して頑健性を向上させられるか?
  • RQ3再構成ベースの学習は、画像生成に依存せずに、ポーズおよびアイデンティティの変化に対して感情特徴の頑健性を向上させられるか?
  • RQ4提案手法は、複数ポーズ、屋外環境下の顔の感情認識ベンチマークにおいて、既存の最先端手法を上回る性能を示すか?
  • RQ5特に合成データやデータ拡張に依存する手法と比較して、ターゲットドメインでのラベル付きデータが限られた状況下で、本手法はどのように性能を発揮するか?

主な発見

  • SFEW データセットでは、提案手法が平均正解率 31.3% を達成し、次に良い手法(UPADA R+adv+cross)の 30.9% を上回った。
  • AffectNet で学習し、SFEW でテストした場合、平均正解率は 57.6% を達成し、前回の最先端手法(UPADA R+adv+cross)の 56.3% を上回った。
  • AffectNet テストセットでは、平均正解率 59.0% を達成し、次に良い手法(UPADA R+adv+cross)の 58.3% を上回った。
  • 珍しいまたは不均衡な感情カテゴリ(例:驚き(SU))においても優れた性能を示し、AffectNet で学習した SFEW では 29.8% を達成した(IPFR は 31.4% だが、クラスごとのバランスが劣る)。
  • アブレーションスタディにより、敵対的適応、クロス敵対的学習、再構成の3つのコンポーネントが性能向上に顕著に寄与しており、特に再構成が最大の貢献を示した。
  • 不自然な生成画像から生じるノイズに苦しむ GAN ベースの手法(GARN や IA-gen よりも)を上回り、実データから直接頑健な特徴を学習することで優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。