Skip to main content
QUICK REVIEW

[論文レビュー] A Multi-modal and Multi-task Learning Method for Action Unit and Expression Recognition

Yue Jin, Tianqing Zheng|arXiv (Cornell University)|Jul 9, 2021
Emotion and Mood Recognition参考文献 22被引用数 21
ひとこと要約

本論文は、視覚的および音声的入力の両方を用いて、顔のアクションユニット(AUs)と表情を同時に認識するマルチモーダルでマルチタスク学習のフレームワークを提案する。視覚的バックボーンをAUsと表情分類ヘッドで共有して訓練し、それを固定した後、トランスフォーマー・エンコーダーを用いて視覚的および音声的特徴を統合することで、Aff-Wild2の検証セットにおいてAUs認識スコア0.712、表情認識スコア0.477を達成し、ベースラインを著しく上回った。

ABSTRACT

Analyzing human affect is vital for human-computer interaction systems. Most methods are developed in restricted scenarios which are not practical for in-the-wild settings. The Affective Behavior Analysis in-the-wild (ABAW) 2021 Contest provides a benchmark for this in-the-wild problem. In this paper, we introduce a multi-modal and multi-task learning method by using both visual and audio information. We use both AU and expression annotations to train the model and apply a sequence model to further extract associations between video frames. We achieve an AU score of 0.712 and an expression score of 0.477 on the validation set. These results demonstrate the effectiveness of our approach in improving model performance.

研究の動機と目的

  • データがノイズが多く、不均衡であるリアルワールドの「いわゆる野生」の動画環境における感情認識の課題に対処すること。
  • 視覚的および音声的モダリティを活用することで、アクションユニット(AU)および顔の表情認識の性能を向上させること。
  • タスク固有の損失関数とマルチタスク学習を用いて、AUおよび表情データセットにおけるクラスの不均衡を軽減すること。
  • トランスフォーマーを用いたエンコーダーを用いて、顔のフレーム系列における長距離の依存関係を効果的にモデル化すること。
  • AUと表情の検証セット間のデータ漏洩を防ぐことで、公平な評価を保証すること。

提案手法

  • Glint360Kを用いてCosface損失で訓練されたマルチタスクの視覚的バックボーンが、AUsと表情分類ヘッドの共有重みを用いて、強固な顔特徴を抽出する。
  • AU認識には、正例の不均衡を補うためにクラスウェイト付きのBCE損失が使用され、表情認識には、難易度の高い例に注目するためのファーコス損失が使用される。
  • 視覚モデルは事前学習後に固定され、Melスペクトログ램を入力とするTDNNベースのモデルを用いて音声特徴を抽出する音声ストリームが追加される。
  • 視覚的および音声的特徴が連結され、1層のトランスフォーマー・エンコーダーに供給され、動画フレーム間の時間的ダイナミクスをモデル化する。
  • Aff-Wild2データセットにおける不完全なアノテーションに対応するため、AUおよび表情ヘッドの学習をエポックまたはバッチ単位で交互に繰り返す。
  • 最終的な予測ヘッドは、フレームごとのAUおよび表情の確率を出力する全結合層である。

実験結果

リサーチクエスチョン

  • RQ1AUsと表情の共同マルチタスク学習が、野生の状況下での感情認識性能を向上させることができるか?
  • RQ2視覚的特徴に加えて音声モダリティを組み込むことで、単独の視覚的特徴に比べてAUsおよび表情認識性能が向上するか?
  • RQ3トランスフォーマーを用いた系列モデルは、感情認識のための顔のフレーム系列における時間的依存関係をどれほど効果的に捉えられるか?
  • RQ4BCE損失とファーコス損失をそれぞれ用いることで、AUおよび表情データセットにおけるクラスの不均衡はどの程度軽減可能か?
  • RQ5マルチモーダルでマルチタスクのフレームワークは、実世界の動画環境における過学習を軽減し、一般化性能を向上させることができるか?

主な発見

  • 提案手法は、Aff-Wild2の検証セットにおいてAU認識スコア0.712を達成し、ベースラインの0.31を著しく上回った。
  • 表情認識に関しては、スコア0.477を達成し、ベースラインの0.366を上回り、顕著な改善が確認された。
  • 視覚的および音声的モダリティの両方を用いることで、単独の視覚的データに比べて性能が向上し、特に困難な野生の状況下で顕著であった。
  • 交互にバックプロパゲーションを行うマルチタスク学習戦略により、AUおよび表情データセットにおける不完全なアノテーションを効果的に処理できた。
  • トランスフォーマー・エンコーダーは長距離の時間的依存関係を効果的にモデル化し、系列レベルの認識精度を向上させた。
  • 重複する検証サンプルを削除することでデータ漏洩を回避したアブレーションにより、モデル性能の公平かつ信頼できる評価が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。