Skip to main content
QUICK REVIEW

[論文レビュー] PAtt-Lite: Lightweight Patch and Attention MobileNet for Challenging Facial Expression Recognition

Jia Le Ngwe, Kian Ming Lim|arXiv (Cornell University)|Jun 16, 2023
Emotion and Mood Recognition参考文献 49被引用数 4
ひとこと要約

PAtt-Lite は、パッチ抽出ブロックと自己注意メカニズム分類器を備えた軽量な MobileNetV1 ベースのモデルを提案し、オクルージョンやポーズ変動といった困難な条件下での顔の感情認識(FER)を向上させる。局所的な顔特徴に注目し、注意メカニズムによる特徴表現の強化により、CK+、RAF-DB、FER2013、FERPlus およびそれらの困難なサブセットで最先端の精度を達成し、パrameter数がたった 1.10M のわずかで実現した。

ABSTRACT

Facial Expression Recognition (FER) is a machine learning problem that deals with recognizing human facial expressions. While existing work has achieved performance improvements in recent years, FER in the wild and under challenging conditions remains a challenge. In this paper, a lightweight patch and attention network based on MobileNetV1, referred to as PAtt-Lite, is proposed to improve FER performance under challenging conditions. A truncated ImageNet-pre-trained MobileNetV1 is utilized as the backbone feature extractor of the proposed method. In place of the truncated layers is a patch extraction block that is proposed for extracting significant local facial features to enhance the representation from MobileNetV1, especially under challenging conditions. An attention classifier is also proposed to improve the learning of these patched feature maps from the extremely lightweight feature extractor. The experimental results on public benchmark databases proved the effectiveness of the proposed method. PAtt-Lite achieved state-of-the-art results on CK+, RAF-DB, FER2013, FERPlus, and the challenging conditions subsets for RAF-DB and FERPlus.

研究の動機と目的

  • オクルージョンやポーズ変動といった、実世界の「野生」状態での顔の感情認識(FER)の正確な認識を課題とする。
  • 既存のデータセットにあまり存在しないレアな否定的表現(嫌悪、恐怖など)のクラスアンバランス問題を克服する。
  • 大規模でリソースを食うニューラルネットワークに依存せずに、高精度を維持する軽量な FER モデルを開発する。
  • MobileNetV1 の特徴表現を向上させるために、局所的なパッチ抽出と注意ベースの分類を導入する。

提案手法

  • モデルサイズと計算コストを削減するため、ImageNet で事前学習された MobileNetV1 を微調整してバックボーン特徴抽出器として使用する。
  • 軽量なパッチ抽出ブロックにより、MobileNetV1 の特徴マップを重複のない4つの空間領域に分割し、顔の顕著な局所的特徴に注目する。
  • グローバル平均プーリングの直後に自己注意分類器を挿入し、全結合層間のドット積注意メカニズムを用いて特徴マップ内の長距離依存性をよりよくモデル化する。
  • パッチ抽出ブロックと注意分類器を統合した軽量なアーキテクチャを構築し、困難な条件下での表現学習を強化する。
  • CK+、RAF-DB、FER2013、FERPlus といった公開 FER ベンチマークでエンドツーエンド学習を行い、困難な条件サブセットでファインチューニングを実施する。
  • 標準ベンチマークおよび困難なサブセット(オクルージョン、ポーズ >30°、ポーズ >45°)を用いて評価し、耐障害性を評価する。

実験結果

リサーチクエスチョン

  • RQ1オクルージョンや極端なポーズといった困難な条件下で、軽量なパッチ抽出機構が FER のパフォーマンスを向上させられるか?
  • RQ2軽量な MobileNetV1 バックボーンに自己注意分類器を統合することで、FER における特徴表現と分類精度が向上するか?
  • RQ3標準的および困難な FER ベンチマークにおいて、PAtt-Lite は最先端の手法と比較して、精度とパrameter効率の両面で優れているか?
  • RQ4クラスアンバランスの影響を受ける低リソースな表現クラス(嫌悪、恐怖など)に対しても、提案手法は性能の低下を効果的に緩和できるか?

主な発見

  • CK+ データセットでは、トップ-1 精度 98.12% を達成し、以前の手法を上回る最先端の精度を実現した。
  • RAF-DB では、オクルージョンサブセットで 92.23%、Pose >30° で 95.35%、Pose >45° で 94.44% の精度を達成し、以前の最先端手法(Facial Chirality)を 3% 以上上回り、パrameter 数も著しく少なかった。
  • FERPlus では、オクルージョンで 93.22%、Pose >30° で 96.07%、Pose >45° で 92.58% の精度を達成し、3 つの困難なサブセットすべてで 90% を超える最初の手法となった。
  • FERPlus において、RAN [5] よりも全体の精度で 6.39% 高く、パrameter 数は 10 分の 1(1.10M 対 11.2M)で実現した。
  • RAF-DB および FER2013 において、すべてのクラスを除く(Contempt, Disgust, Fear を除く)95% 以上の精度を達成し、クラスアンバランスのため性能低下が予想される。
  • アブレーションスタディにより、パッチ抽出ブロックと注意分類器の両方が、特に困難な条件下で顕著なパフォーマンス向上に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。