Skip to main content
QUICK REVIEW

[論文レビュー] Facial Affect Recognition in the Wild Using Multi-Task Learning Convolutional Network

Zihang Zhang, Jianping Gu|arXiv (Cornell University)|Feb 3, 2020
Emotion and Mood Recognition参考文献 11被引用数 7
ひとこと要約

本論文では、Aff-Wild2データセットを用いて、次を同時に推定するためのマルチタスク畳み込みニューラルネットワーク、MTANetを提案する。感情の次元的評価(価値と覚醒)、顔の動き単位(AUs)の検出、7つの基本感情の分類。SENet-50に基づくマルチタスク畳み込みニューラルネットワークであり、ハードパラメータ共有とアテンション機構を活用することで、価値のCCCが0.28、覚醒のCCCが0.34、AUs検出のF1スコアが0.427、分類感情認識のF1スコアが0.32を達成した。

ABSTRACT

This paper presents a neural network based method Multi-Task Affect Net(MTANet) submitted to the Affective Behavior Analysis in-the-Wild Challenge in FG2020. This method is a multi-task network and based on SE-ResNet modules. By utilizing multi-task learning, this network can estimate and recognize three quantified affective models: valence and arousal, action units, and seven basic emotions simultaneously. MTANet achieve Concordance Correlation Coefficient(CCC) rates of 0.28 and 0.34 for valence and arousal, F1-score of 0.427 and 0.32 for AUs detection and categorical emotion classification.

研究の動機と目的

  • 非制約的、現実世界の状況で、次元的感情(価値と覚醒)、顔の動き単位(AUs)の検出、基本感情の分類を同時に推定できる深層学習モデルの開発。
  • タスク間の共有表現が特徴学習と一般化を向上させることで、野生の状況下における感情認識性能の向上。
  • チャネルワイドアテンション(SE-Net)とマルチヘッドアテンション機構を統合し、顔の感情認識における特徴表現品質の向上。
  • マルチモodalかつマルチタスク学習を支援する大規模で動的で完全にアノテーションが付与されたAff-Wild2データセットを用いて、モデルの評価。
  • 複数の感情的タスクを統合的に学習することで、単一タスクのベースラインと比較して、すべての個別タスクのパフォーマンスが向上することの実証。

提案手法

  • MTANetは、整列済みの112×112の顔画像から2048次元の特徴を抽出するため、SENet-50を共有バックボーンとして用い、平均プーリングと最大プーリング、ドロップアウト、ReLUを用いて特徴の精錬。
  • 価値/覚醒の回帰、AUsのマルチラベル分類、分類感情分類の3つのタスク間で、ハードパラメータ共有エンコーダーを用いて特徴を共有。
  • デコーダーは、それぞれ価値と覚醒の出力次元が2、8つのAUsの出力次元が8、基本感情の出力次元が7の全結合層から構成される。
  • 損失関数には、感情分類のためのカテゴリカルクロスエントロピー、AUs検出のためのバイナリクロスエントロピー、価値と覚醒の回帰のための一致相関係数(CCC)を用いる。
  • 同分散不確実性を用いた重み付き総損失を適用し、タスク固有の損失重みをエンドツーエンドで学習することで、マルチタスク最適化のバランスをとる。
  • モデルはAdamを用いて訓練され、VGGFace2で事前学習されたSENet-50を用いて微調整され、Aff-Wild2の検証セットで評価された。

実験結果

リサーチクエスチョン

  • RQ1マルチタスク深層学習フレームワークは、野生の状況下で、次元的、FACSベース、分類的モデルの顔の感情認識のパフォーマンスを同時に向上させることができるか?
  • RQ2チャネルワイドアテンション(SE-Net)の統合は、非制約的条件下での顔の感情認識における特徴表現をどのように向上させるか?
  • RQ3複数の感情的タスク間でハードパラメータ共有を適用することで、単一タスクのベースラインと比較して、より優れた一般化とパフォーマンスが得られるか?
  • RQ4不確実性に基づく損失バランスを用いた重み付きマルチタスク学習は、異種の感情的タスクにおいて収束性とパフォーマンスをどの程度向上させるか?
  • RQ5MTANetは、Aff-Wild2ベンチマークにおいて、CCC、F1スコア、分類精度の観点から、既存手法と比較してどの程度優れているか?

主な発見

  • MTANetは、Aff-Wild2の検証セットで、価値のCCCが0.28、覚醒のCCCが0.34を達成し、ベースライン手法を上回った。
  • AUs検出のF1スコアが0.427、分類感情認識のF1スコアが0.32を達成し、マルチラベルおよびマルチクラスタスクにおいて優れたパフォーマンスを示した。
  • 検証されたバックボーンの中で、SENet-50が最高の全体的パフォーマンスを示し、ResNext-50やCBAMを統合したResNext-50よりも高いCCCとF1スコアを達成した。
  • アテンション機構(SE-Net)の統合により、非アテンションベースラインと比較して一貫したパフォーマンス向上が示され、特徴表現の向上が顕著に確認された。
  • 不確実性重み付き損失による微調整は、単純な損失和算と比較してパフォーマンスが向上した。これは、効果的なタスクバランスが図られたことを示している。
  • より深い線形ヘッド設計は結果を向上させず、現在のアーキテクチャがすでにタスクに最適化されていることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。