Skip to main content
QUICK REVIEW

[論文レビュー] POSTER: A Pyramid Cross-Fusion Transformer Network for Facial Expression Recognition

Ce Zheng, Matías Mendieta|arXiv (Cornell University)|Apr 8, 2022
Emotion and Mood Recognition被引用数 8
ひとこと要約

本論文は、顔の顔認識特徴と画像特徴をトランスフォーマーに基づくクロスフュージョン機構を用いて統合的に活用することで、顔の感情認識におけるクラス間類似性、クラス内差異、スケール感受性の3つの課題に同時に対処する、2ストリームのピラミッドクロスフュージョントランスフォーマーネットワークであるPOSTERを提案する。本手法は、注目ガイド付き特徴相互作用とマルチスケール特徴ピラミッドを活用することで、性能向上とロバスト性の向上を達成し、RAF-DBでは92.05%、AffectNet 7クラスでは67.31%の精度を達成し、最先端性能を実現した。

ABSTRACT

Facial expression recognition (FER) is an important task in computer vision, having practical applications in areas such as human-computer interaction, education, healthcare, and online monitoring. In this challenging FER task, there are three key issues especially prevalent: inter-class similarity, intra-class discrepancy, and scale sensitivity. While existing works typically address some of these issues, none have fully addressed all three challenges in a unified framework. In this paper, we propose a two-stream Pyramid crOss-fuSion TransformER network (POSTER), that aims to holistically solve all three issues. Specifically, we design a transformer-based cross-fusion method that enables effective collaboration of facial landmark features and image features to maximize proper attention to salient facial regions. Furthermore, POSTER employs a pyramid structure to promote scale invariance. Extensive experimental results demonstrate that our POSTER achieves new state-of-the-art results on RAF-DB (92.05%), FERPlus (91.62%), as well as AffectNet 7 class (67.31%) and 8 class (63.34%). The code is available at https://github.com/zczcwh/POSTER.

研究の動機と目的

  • 顔の感情認識における3大課題(クラス間類似性、クラス内差異、スケール感受性)に対処すること。
  • これらの課題を1つのディーブラーニングフレームワーク内で統合的に処理すること。これは、従来の手法が完全に達成できていない。
  • 顔認識特徴をスパースで顕著な領域ガイドとして活用し、微細な感情の兆候への注目を向上させること。
  • 特徴ピラミッド構造を統合することで、異なる画像解像度に対するスケール不変性を向上させること。
  • 画像特徴と顔認識特徴の間でグローバルかつ双方向の注目を可能にするクロスフュージョントランスフォーマー機構を開発すること。

提案手法

  • POSTERは、画像ストリームにResNet-50バックボーン、顔認識ストリームにMobileFaceNetを用いた2ストリームアーキテクチャを採用している。
  • 新規のクロスフュージョントランスフォーマーブロックを導入し、一方のストリームのクエリが他方のストリームのキーとバリューに注目することで、双方向の特徴相互作用を実現する。
  • クロスフュージョングメカニズムは、画像特徴と顔認識特徴の両方からQ、K、Vの投影を用い、一方のストリームからQを、他方からKとVを取得することで、グローバルな相関関係と文脈に配慮した特徴の最適化を可能にする。
  • ネットワークは特徴ピラミッド構造を組み込み、マルチスケール特徴を抽出することで、入力画像のスケール変動に対するロバスト性を向上させる。
  • 最終的な分類ヘッドは、統合された表現からの特徴を用い、標準的なFERベンチマーク上でエンドツーエンドで全ネットワークを訓練する。
  • 性能と効率のバランスを図るため、深さが増す(4、6、8個のクロスフュージョントランスフォーマーブロック)3つのバージョン—POSTER-T、POSTER-S、POSTER—を実装した。

実験結果

リサーチクエスチョン

  • RQ1統合的なディーブラーニングフレームワークは、顔の感情認識におけるクラス間類似性、クラス内差異、スケール感受性を効果的に解消できるか?
  • RQ2画像特徴と顔認識特徴の間のクロスアテンションは、微細な感情差異に対するモデルのロバスト性をどのように向上させるか?
  • RQ3特徴ピラミッドの統合は、FERモデルにおけるスケール不変性をどの程度向上させるか?
  • RQ4提案されたクロスフュージョントランスフォーマーメカニズムは、顔認識特徴と画像特徴の単純な連結や初期統合に比べて優れているか?
  • RQ5クロスフュージョントランスフォーマーブロックの数を変化させた場合、モデルの複雑さと性能のトレードオフはどのようになるか?

主な発見

  • POSTERは、RAF-DBデータセットで92.05%という新たな最先端の精度を達成し、従来手法を上回った。
  • 7クラスのAffectNetでは、67.31%の精度を達成し、以前の最先端手法に比べて顕著な向上を示した。
  • 混同行列の結果から、POSTERは全感情カテゴリにおいて誤分類率を低減し、対角線の精度を向上させ、クラス内差異の低減が確認された。
  • Qを画像特徴から、K/Vを顔認識特徴から取得するようにした、QとK/Vの入れ替えを施したクロスフュージョングメカニズムが最良の性能を示し、注目方向の重要性を裏付けた。
  • POSTER-Tはパラメータ数が52.2Mで、DMUEと同等のFLOPsを有しながら、RAF-DBでは2.55%、AffectNetでは4.19%の高い精度を達成し、優れた性能を示した。
  • 8個のクロスフュージョントランスフォーマーブロックを有する完全版POSTERは、最高の精度を達成した。これは、計算コストの許容範囲内で、より深い統合が性能向上に寄与することを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。