Skip to main content
QUICK REVIEW

[論文レビュー] Intensity-Aware Loss for Dynamic Facial Expression Recognition in the Wild

Hanting Li, Hongjing Niu|arXiv (Cornell University)|Aug 19, 2022
Emotion and Mood Recognition被引用数 5
ひとこと要約

本稿では、低強度の表現が小クラス間差と大クラス内差のため、しばしば誤分類される「野生下」の動的顔面表情認識(DFER)を改善するために、新規の強度に敏感な損失(IAL)とグローバル畳み込み注意ブロック(GCA)を提案する。GCAは低強度サンプルの特徴を強化するとともに不要なチャネルを抑制し、IALは識別が難しい低強度シーケンスに焦点を当てて学習を促進し、DFEWおよびFV39kデータセットで最先端の性能を達成した。

ABSTRACT

Compared with the image-based static facial expression recognition (SFER) task, the dynamic facial expression recognition (DFER) task based on video sequences is closer to the natural expression recognition scene. However, DFER is often more challenging. One of the main reasons is that video sequences often contain frames with different expression intensities, especially for the facial expressions in the real-world scenarios, while the images in SFER frequently present uniform and high expression intensities. However, if the expressions with different intensities are treated equally, the features learned by the networks will have large intra-class and small inter-class differences, which is harmful to DFER. To tackle this problem, we propose the global convolution-attention block (GCA) to rescale the channels of the feature maps. In addition, we introduce the intensity-aware loss (IAL) in the training process to help the network distinguish the samples with relatively low expression intensities. Experiments on two in-the-wild dynamic facial expression datasets (i.e., DFEW and FERV39k) indicate that our method outperforms the state-of-the-art DFER approaches. The source code will be made publicly available.

研究の動機と目的

  • 変動する表現強度、特に低強度サンプルに起因する、野生下の動的顔面表情認識(DFER)における誤分類の課題に対処すること。
  • 低強度表現の特徴を強化することで、クラス内分散を低減し、クラス間分離を向上させること。
  • 低強度シーケンスに特化した関連する特徴を優先することができる、プラグアンドプレイ型モジュール(GCA)を設計すること。
  • トレーニング中に識別が難しい低強度サンプルに特に注目する新規の損失関数(IAL)を提案すること。
  • 強度ラベルを必要としない実世界の野生下DFERデータセットにおいて、本手法の有効性を示すこと。

提案手法

  • グローバル畳み込み注意(GCA)ブロックは、チャネルごとの情報を集約し、特徴マップを再スケーリングすることで、低強度表現に特化したチャネルを強化するとともに、重要でないものを抑制する。
  • GCAは、アーキテクチャの大幅な見直しを必要とせず、既存のDFERモデルに容易に統合可能なプラグアンドプレイモジュールとして設計されている。
  • 強度に敏感な損失(IAL)は、低信頼度で予測されたサンプルの損失重みを増加させることで定式化されており、特に低表現強度のものに焦点を当てる。
  • IALは予測信頼度を分析することで識別が難しいサンプルを特定し、各低強度シーケンスについて最も混乱しやすいクラスにネットワークの注目を向けさせる。
  • GCAをバックボーンネットワークに挿入して特徴表現を精錬し、クロスエントロピー損失に加えてIALを組み合わせて、エンドツーエンドで学習を行う。
  • 本手法は、動的サンプリングと標準評価プロトコルを用いて、2つの野生下DFERベンチマーク(DFEWおよびFV39k)で評価された。

実験結果

リサーチクエスチョン

  • RQ1実世界の動画シーケンスにおける表現強度の変動が、離散ラベル型DFERモデルの性能にどのように影響を与えるか?
  • RQ2強度ラベルを必要としない条件下で、学習可能な注目メカニズムが低強度顔面表現の特徴表現をどのように向上させられるか?
  • RQ3識別が難しい低強度サンプルに焦点を当てた損失関数が、DFERにおけるクラス間分離をどの程度向上させられるか?
  • RQ4提案されたGCAブロックは、低強度表現の特徴を効果的に強化するとともに、不要なチャネルを抑制できるか?
  • RQ5IALとGCAの組み合わせが、野生下DFERベンチマークで最先端の性能を達成できるか?

主な発見

  • DFEWデータセットでは、提案手法のGCA+IALが重み付き平均リcall(WAR)69.24%を達成し、以前の最先端手法(NR-DFERNet)を1.05ポイント上回った。
  • FV39kデータセットでは、WARが48.54%に達し、以前の最高結果(Former-DFER)を1.34ポイント上回った。
  • 可視化結果から、低強度およびニュートラルな表現の特徴が、非ニュートラルクラスの中心に集中するのではなく、より明確に分離されていることが示された。
  • t-SNE可視化により、本手法が「ニュートラル」と「驚き」のクラス、特に低強度状況で頻繁に混同されるクラスにおいても、より識別性の高い特徴を学習していることが確認された。
  • アブレーションスタディの結果、GCAとIALの両方が性能向上に顕著な寄与をしていることが示され、特にIALが識別が難しいサンプルの認識向上において顕著な効果を示した。
  • DFEWおよびFV39kの両方で複数の指標において最先端の性能を達成しており、本手法が実世界の状況においても強力で汎用性の高い性能を示していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。