Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Emotion Descriptors Estimation at the ABAW3 Challenge

Didan Deng|arXiv (Cornell University)|Mar 24, 2022
Emotion and Mood Recognition被引用数 4
ひとこと要約

本稿では、心理的理論に基づき、顔の行動単位(AUs)と感情的メッセージ(感情の正負、覚醒度、離散的表現)を別々にモデル化する、SMM-EmotionNetと呼ばれる新しいマルチタスク深層学習アーキテクチャを提案する。信号の根拠(sign vehicles)と感情のメッセージ(messages)に分かれた別々のブランチを採用し、時間的スムージングを適用することで、ABAW3チャレンジにおいて、単一タスクおよびマルチタスクのベースラインをすべての指標で上回る最先端の性能を達成した。

ABSTRACT

To describe complex emotional states, psychologists have proposed multiple emotion descriptors: sparse descriptors like facial action units; continuous descriptors like valence and arousal; and discrete class descriptors like happiness and anger. According to Ekman and Friesen, 1969, facial action units are sign vehicles that convey the emotion message, while discrete or continuous emotion descriptors are the messages perceived and expressed by human. In this paper, we designed an architecture for multiple emotion descriptors estimation in participating the ABAW3 Challenge. Based on the theory of Ekman and Friesen, 1969, we designed distinct architectures to measure the sign vehicles (i.e., facial action units) and the message (i.e., discrete emotions, valence and arousal) given their different properties. The quantitative experiments on the ABAW3 challenge dataset has shown the superior performance of our approach over two baseline models.

研究の動機と目的

  • 動画シーケンスにおいて、顔の行動単位(AUs)、正負/覚醒度(VA)、離散的表現といった複数の感情記述子を同時に推定する課題に取り組むこと。
  • 心理的理論(Ekman & Friesen, 1969)をモデルアーキテクチャ設計に組み込み、観察者依存性や行動的性質の異なる信号の根拠(AUs)と感情のメッセージ(EXPR, VA)を区別すること。
  • 心理的事前知識を用いて特徴学習を正則化し、感情推定における観察者間ばらつきを低減することで、低アノテーション環境下での性能を向上させること。
  • 単純なスムージングを用いた時間的モデリングを通じて、ノイズを低減し、逐次的予測の整合性を向上させること。

提案手法

  • 二重ブランチアーキテクチャを設計:信号の根拠(AUs)のためのブランチには、Jacob & Stenger (2021) が提案したイントラおよびインタラ・AUs注意メカニズムを適用し、感情のメッセージ(EXPR, VA)のためのブランチには、領域ベースの特徴投影により共有メッセージ空間にマッピングする。
  • 顔の異なる領域からの視覚的特徴を共有メッセージ空間に投影し、それらを平均化することで感情のメッセージに関する一貫性を高め、観察者依存性のばらつきを低減する。
  • 時間的スムージングに再帰フィルタを適用:$\Lambda_t = \frac{1}{1+\mu}(\epsilon_t + \mu\Lambda_{t-1})$、ここで$\mu$はグリッドサーチにより最適化され、AUs、EXPR、VAタスクの性能を向上させる。
  • 共有特徴抽出器(例:InceptionV3 や VGG-Face)を用い、その後にタスク固有の全結合ヘッドを接続して、AUs検出、離散的表現分類、連続的VA回帰を実行する。
  • 300,000イテレーションにわたりコサインスケジューリングを用いた学習率スケジューリングで訓練し、分類タスクには交差エントロピー、回帰タスクには平均二乗誤差を用いる。
  • F1スコア(AUsおよびEXPR用)、CCC(VA用)を組み合わせたマルチタスク損失を最適化し、最終評価指標において等価な重みを付与する。

実験結果

リサーチクエスチョン

  • RQ1深層学習アーキテクチャにおいて、信号の根拠(例:AUs)と感情のメッセージ(例:正負、覚醒度、離散的表現)の間にある心理的差異を効果的にモデル化する方法は何か?
  • RQ2信号の根拠と感情のメッセージの学習を分離することで、とくにアノテーションが限られた状況下でも、複数の感情記述子推定タスクの性能向上が達成可能か?
  • RQ3メッセージ空間および信号の根拠空間における特徴の時間的スムージングは、逐次的感情認識におけるモデルのロバスト性と性能向上に寄与するか?
  • RQ4観察者依存的認識やAUsの共起性といった心理的事前知識を組み込むことで、感情推定における一般化性能の向上と観察者間ばらつきの低減がどの程度達成できるか?

主な発見

  • 提案されたSMM-EmotionNetは、ABAW3チャレンジのAUs検出タスクで検証用F1-AUスコア0.548を達成し、ベースラインのInceptionV3(0.536)およびVGG-Face(0.39)を上回った。
  • 離散的表現分類においては、マクロF1スコア0.518を達成し、InceptionV3ベースライン(0.489)およびVGG-Face(0.23)を上回った。
  • 連続的感情予測では、正負(valence)に対してCCC 0.447、覚醒度(arousal)に対してCCC 0.499を達成し、InceptionV3ベースライン(0.441および0.485)を上回った。
  • 時間的スムージング手法により、マルチタスク評価指標(式9)は検証セットで1.539(静的)から1.664に向上し、テストセットでも1.104から1.113に向上した。これは、全タスクにわたる一貫した向上を示している。
  • 3-fold交差検証の結果、最適なスムージングハイパーパrameterは、AUsに対して$\mu=7$、EXPRおよびVAに対して$\mu=9$であった。第2フォールドでCCC-VAが最高の0.577を記録した。
  • 共有メッセージ空間における複数の顔領域からの一貫性を活用することで、曖昧または矛盾する顔の兆候に対しても、モデルは優れた一般化性能とロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。