Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking the Learning Paradigm for Facial Expression Recognition

Weijie Wang, Li, Bo|arXiv (Cornell University)|Sep 30, 2022
Emotion and Mood Recognition被引用数 5
ひとこと要約

本論文は、主観的なクラウドソーシングによるアノテーションの曖昧性に対処するため、顔の感情認識(FER)の弱教師付き部分ラベル学習(PLL)パラダイムを提案する。自己教師あり特徴表現学習にマスク画像モデリング(MIM)を用い、変換器デコーダーを用いてラベルの信頼性を照会する。RAF-DB、FERPlus、AffectNetで最先端の性能を達成し、完全教師ありSOTA手法を最大1.16%の精度向上で上回った。

ABSTRACT

Due to the subjective crowdsourcing annotations and the inherent inter-class similarity of facial expressions, the real-world Facial Expression Recognition (FER) datasets usually exhibit ambiguous annotation. To simplify the learning paradigm, most previous methods convert ambiguous annotation results into precise one-hot annotations and train FER models in an end-to-end supervised manner. In this paper, we rethink the existing training paradigm and propose that it is better to use weakly supervised strategies to train FER models with original ambiguous annotation.

研究の動機と目的

  • 主観的なクラウドソーシングとクラス間の類似性によって生じる、現実世界の顔の感情データセットに内在する曖昧性に対処する。
  • 曇ったアノテーションをone-hotラベルに変換する一般的な手法が、人工的なノイズを導入することを挑戦する。
  • 元の曇ったアノテーションを保持する、部分ラベル学習(PLL)を用いた画期的な弱教師付き学習パラダイムを提案する。
  • 自己教師ありマスク画像モデリング(MIM)事前学習を活用して、ラベルの曇りがある状況下でも表現学習を向上させる。
  • 画像特徴とのクロスアテンションにより、各候補ラベルの信頼性スコアを計算する、クエリベースのラベル曇り解除機構を考案する。

提案手法

  • 各サンプルが正しいラベルを含む候補ラベルの集合に関連付けられる部分ラベル学習(PLL)問題としてFERを定式化する。
  • ImageNet-1KおよびFER固有のデータを用いて、視覚変換器バックボーンをマスク画像モデリング(MIM)で事前学習し、頑健な自己教師あり顔の感情表現を学習する。
  • 画像特徴とのクロスアテンションにより、各候補ラベルの信頼性スコアを計算するため、学習可能なクラス埋め込みを変換器デコーダーのクエリとして用いる。
  • クラスの不均衡を軽減するため、クエリ埋め込みをハイパースフィア上に一様に分布させるラベル均一埋め込み正則化損失($\mathcal{L}_{uniform}$)を導入する。
  • 信頼性の高い曇り解除意思決定を評価することで、ラベル予測を精緻化するためのリビジョン信頼度モジュールを適用する。
  • 予測ラベル信頼度の交差エントロピー損失を最適化することで、全体のモデルをPLL設定でエンドツーエンドに微調整する。

実験結果

リサーチクエスチョン

  • RQ1FERの学習において曇ったアノテーションを保持することで、one-hotラベルに変換する手法よりも高い性能が達成可能か?
  • RQ2ラベルが曇っている状況下でも、マスク画像モデリング(MIM)が頑健な顔の感情表現を学習するのにどの程度有効か?
  • RQ3変換器デコーダーを用いたラベル信頼度クエリ機構は、FERのPLLにおけるラベル曇り解除をどの程度向上させるか?
  • RQ4提案されたPLLフレームワークは、現実世界のFERベンチマークで完全教師ありSOTA手法を上回るか?
  • RQ5ラベル均一正則化やリビジョン信頼度といった補助モジュールは、曇り解除性能にどの程度寄与するか?

主な発見

  • 提案されたPLLベースの手法は、RAF-DBで92.05%の精度を達成し、以前のSOTA(DMUE)を0.91%上回った。
  • FERPlusでは、MIM事前学習とPLLを組み合わせたことで、SOTAを1.16%上回り、90.35%の精度を達成した。
  • AffectNetでは、同じバックボーンを用いたベースラインより0.55%高い67.11%の精度を達成した。
  • アブレーションスタディにより、変換器デコーダーモジュールはRAF-DBで0.94%、AffectNet7で0.55%の精度向上をもたらしたことが確認された。
  • MIM事前学習においてピクセルレベルの予測の代わりにHOG特徴量を用いることで、より高い性能(90.35% vs. 90.09%)が得られた。これはHOGがFERに適していることを示唆している。
  • MIM事前学習とPLLの組み合わせは、SL事前学習よりも0.72%の精度向上をもたらし、ラベルの曇りがある状況下での自己教師あり学習の利点を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。