Skip to main content
QUICK REVIEW

[論文レビュー] Two-level Attention with Two-stage Multi-task Learning for Facial Emotion Recognition

Xiaohua Wang, Muzi Peng|arXiv (Cornell University)|Nov 29, 2018
Emotion and Mood Recognition参考文献 1被引用数 10
ひとこと要約

本論文は、静的画像からの顔の感情認識のための二段階のマルチタスク学習フレームワーク(2Att-2Mt)を提案する。位置レベルおよびレイヤー レベルのアテンション機構を用いて特徴表現を強化し、同時に感情の評価値(valence)と覚醒度(arousal)を同時に予測するマルチタスク学習を採用している。AffectNetで最先端の性能を達成し、評価値のCCCは0.714、覚醒度のCCCは0.556を記録し、優れたロバストネスと一般化性能を示している。

ABSTRACT

Compared with facial emotion recognition on categorical model, the dimensional emotion recognition can describe numerous emotions of the real world more accurately. Most prior works of dimensional emotion estimation only considered laboratory data and used video, speech or other multi-modal features. The effect of these methods applied on static images in the real world is unknown. In this paper, a two-level attention with two-stage multi-task learning (2Att-2Mt) framework is proposed for facial emotion estimation on only static images. Firstly, the features of corresponding region(position-level features) are extracted and enhanced automatically by first-level attention mechanism. In the following, we utilize Bi-directional Recurrent Neural Network(Bi-RNN) with self-attention(second-level attention) to make full use of the relationship features of different layers(layer-level features) adaptively. Owing to the inherent complexity of dimensional emotion recognition, we propose a two-stage multi-task learning structure to exploited categorical representations to ameliorate the dimensional representations and estimate valence and arousal simultaneously in view of the correlation of the two targets. The quantitative results conducted on AffectNet dataset show significant advancement on Concordance Correlation Coefficient(CCC) and Root Mean Square Error(RMSE), illustrating the superiority of the proposed framework. Besides, extensive comparative experiments have also fully demonstrated the effectiveness of different components.

研究の動機と目的

  • 現実世界(イン・ザ・ワイルド)の状況下における静的画像からの正確な次元的顔の感情認識の課題に対処すること。
  • 動画、音声、マルチモodalデータに依存する従来手法の制限を克服し、単一の静止画像に焦点を当てること。
  • 位置レベルおよびレイヤー レベルのアテンション機構を統合することで、空間的および階層的関係を捉えることにより、特徴表現を向上させること。
  • 分類的表現と次元的表現の相関関係を活用し、評価値と覚醒度の回帰性能を向上させること。
  • 回帰段階でTukeyのバイウィー卜損失関数を適用し、ノイズが多いまたは誤ラベルが付与されたデータに対するロバストネスを向上させること。

提案手法

  • 顔画像から自動的に位置レベル特徴(領域特徴)を抽出・強化するため、残差アテンションブロックを採用する。
  • 双方向RNNと自己アテンションを用いて、ネットワークの異なるレイヤー間の特徴間の関係をモデル化し、長距離依存性を捉える(レイヤー レベル特徴)。
  • 二段階のマルチタスク学習構造を実装する:まず分類的感情(例:エクマンの6つの基本的感情)を予測し、次にその予測結果をもとに連続的評価値と覚醒度の回帰をガイド・改善する。
  • 共有ヘッドとタスク固有ヘッドを併用して、評価値と覚醒度を同時に回帰し、それらの内在的相関を活用して一般化性能を向上させる。
  • 回帰段階でTukeyのバイウィー卜損失関数を適用し、外れ値や誤ラベル付きサンプルの影響を抑制することで、モデルのロバストネスを向上させる。
  • 48×48の入力解像度を用いて、AffectNetデータセット上でエンド・ツー・エンドに全フレームワークを訓練する。

実験結果

リサーチクエスチョン

  • RQ1二段階のアテンション機構は、静的画像における顔の感情認識の特徴表現を効果的に向上させることができるか?
  • RQ2分類的感情予測を評価値と覚醒度の回帰に組み込むことで、次元的感情推定の性能が向上するか?
  • RQ3二段階のマルチタスク学習構造は、評価値、覚醒度、および分類的感情の間の相関関係をどれほど効果的に活用できるか?
  • RQ4Tukeyのバイウィー卜損失関数は、感情認識においてノイズが多いまたは誤ラベルが付与されたデータに対するロバストネスをどの程度向上させるか?
  • RQ5提案されたフレームワークは、再訓練なしに次元的および分類的両方の感情認識タスクに一般化できるか?

主な発見

  • 提案された2Att-2Mtフレームワークは、AffectNetデータセットで評価値のCCCが0.714、覚醒度のCCCが0.556を達成し、ベースライン手法を顕著に上回っている。
  • Tukeyのバイウィー卜損失関数の適用により、MSE損失と比較して平均CCCが0.635(対象0.625)に0.005向上し、外れ値へのロバストネスが向上していることが示された。
  • 二段階のマルチタスク学習構造により、分類的表現を用いて連続的感情の回帰をガイドすることで性能が向上し、特に挑戦的な覚醒度予測において顕著な効果を示した。
  • アーキテクチャの変更なしに、直接的な顔の感情分類(7クラス)で0.48の精度を達成しており、回帰学習に特化したモデルであるにもかかわらず、強力な一般化能力を示している。
  • アブレーションスタディの結果、二段階のアテンションおよび二段階のマルチタスク学習の両構成要素が不可欠であり、最終的な性能向上にそれぞれ顕著な寄与をしていることが確認された。
  • 48×48の入力サイズで最先端の結果を達成しており、従来の手法が使用するより大きな入力解像度と比較しても、本フレームワークは低解像度でも効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。