Skip to main content
QUICK REVIEW

[論文レビュー] Label Distribution Amendment with Emotional Semantic Correlations for Facial Expression Recognition

Shasha Mao, Guanghui Shi|arXiv (Cornell University)|Jul 23, 2021
Emotion and Mood Recognition参考文献 31被引用数 4
ひとこと要約

本稿では、感情の意味的相関を活用してラベルの信頼性を向上させる、顔の感情認識におけるラベル分布修正手法を提案する。意味的クラス関係グラフとタスク空間クラス関係グラフを構築し、それらを比較することで、信頼度に応じてラベル分布を動的に修正する。この手法により、RAF-DBなどのワイルドな表情データセットにおいて、特にノイズが多いまたは曖昧なラベル状況下でも優れた性能が得られる。

ABSTRACT

By utilizing label distribution learning, a probability distribution is assigned for a facial image to express a compound emotion, which effectively improves the problem of label uncertainties and noises occurred in one-hot labels. In practice, it is observed that correlations among emotions are inherently different, such as surprised and happy emotions are more possibly synchronized than surprised and neutral. It indicates the correlation may be crucial for obtaining a reliable label distribution. Based on this, we propose a new method that amends the label distribution of each facial image by leveraging correlations among expressions in the semantic space. Inspired by inherently diverse correlations among word2vecs, the topological information among facial expressions is firstly explored in the semantic space, and each image is embedded into the semantic space. Specially, a class-relation graph is constructed to transfer the semantic correlation among expressions into the task space. By comparing semantic and task class-relation graphs of each image, the confidence of its label distribution is evaluated. Based on the confidence, the label distribution is amended by enhancing samples with higher confidence and weakening samples with lower confidence. Experimental results demonstrate the proposed method is more effective than compared state-of-the-art methods.

研究の動機と目的

  • 顔の感情認識におけるone-hotラベリングの限界、特に現実世界(ワイルド)データセットにおけるラベルの不確実性やノイズの問題に対処すること。
  • 驚きと喜びの感情の共起可能性など、顔の表情同士の内在的かつ多様な相関関係(例えば、驚きと喜びの共起可能性)を意味的空間表現を用いてモデル化すること。
  • 意味的空間とタスク空間のクラス関係グラフを比較することで得られる信頼度に基づき、動的にラベル分布を修正することで、ラベル分布の信頼性を向上させること。
  • 感情の意味的相関を組み込むことで、複合的または曖昧な表情に対して、より正確で解釈可能なラベル分布が得られることを示すこと。

提案手法

  • 顔の画像を意味的空間に埋め込むためにオートエンコーダーが用いられ、顔の表情間のトポロジカルな関係を保持する。
  • 学習された意味的埋め込みに基づいて意味的クラス関係グラフが構築され、内在的な感情的相関(例:驚き-喜び vs. 驚き-無表情)を符号化する。
  • 訓練中のモデルの予測からタスク空間クラス関係グラフが学習され、カテゴリ割り当てに対する現在の信頼度を反映する。
  • 意味的クラス関係グラフとタスク空間クラス関係グラフを比較することで、各サンプルの信頼度が評価され、一貫性のあるまたは一貫性のない相関を持つサンプルが特定される。
  • 信頼度に応じた損失関数を用いて、高信頼度のサンプルの特徴量と確率を強化し、低信頼度のものを抑制することで、ラベル分布が修正される。
  • 元のラベル分布と修正された分布の影響をバランスさせるためにハイパーパrameter β を使用し、ノイズレベルの変動に応じて経験的に最適値が特定される。

実験結果

リサーチクエスチョン

  • RQ1顔の表情間の感情的意味的相関を、顔の感情認識におけるラベル分布の質を向上させるために、どのように効果的にモデル化できるか?
  • RQ2意味的相関は、ワイルドな表情データセットにおけるラベルのノイズや不確実性の影響をどの程度軽減できるか?
  • RQ3意味的空間とタスク空間のクラス関係グラフを比較して得られる信頼度スコアは、曖昧または誤ってラベリングされた顔の表情を信頼性を持って特定できるか?
  • RQ4提案手法によるラベル分布の修正は、深層学習モデルの顔の感情認識性能にどのように影響を与えるか?
  • RQ5本手法は、ベースラインのone-hotラベルや標準的なラベル分布学習手法と比較して、複合表情に対してより解釈可能で現実的なラベル分布を生成できるか?

主な発見

  • 提案手法SCE-ALDは、3つのワイルドな表情データベース(RAF-DB、AffectNet、FER2013)において最先端の性能を達成し、既存のラベル分布学習手法を上回る。
  • RAF-DBで30%の合成ラベルノイズを想定した場合、β = 0.2のとき最高の精度を達成しており、高ノイズ条件下では低β値が最適であることが示された。
  • 本手法はラベルノイズに対して高い耐性を示し、特にノイズが多い状況で性能向上が顕著であり、信頼度に基づくラベル修正の重要性が裏付けられた。
  • 可視化結果から、修正されたラベル分布は意味的に妥当であることが示された。例えば、視覚的に優勢な喜びが支配する複合表情では、喜びの確率が不快感よりも高くなる。
  • 複合RAF-DBにおいて、モデルの予測ラベル分布は人間のアノテート済みマルチラベルとよく一致しており、確率は視覚的顕著性を反映している(例:悲しみがより顕著な場合は、恐怖よりも悲しみの確率が高くなる)。
  • アブレーションスタディにより、ラベル分布の修正機構が不可欠であることが確認され、ベースライン手法(β = 1)は提案された動的修正戦略よりも性能が劣ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。