Skip to main content
QUICK REVIEW

[論文レビュー] Micron-BERT: BERT-based Facial Micro-Expression Recognition

Xuan-Bac Nguyen, Chi Nhan Duong|arXiv (Cornell University)|Apr 6, 2023
Emotion and Mood Recognition被引用数 6
ひとこと要約

本稿では、対角的マイクロアテンション(DMA)を用いて微細なフレーム間差を検出するとともに、背景ノイズを抑制するためのオーダーポイント(POI)モジュールを備えた自己教師付きBERTベースのフレームワーク、Micron-BERT($\mu$-BERT)を提案する。このモデルは、4つのベンチマークで最先端の性能を達成しており、CASME IIでは89.03%の正確性、CASME3では32.64%のUF1を記録し、先行手法を大きく上回っている。

ABSTRACT

Micro-expression recognition is one of the most challenging topics in affective computing. It aims to recognize tiny facial movements difficult for humans to perceive in a brief period, i.e., 0.25 to 0.5 seconds. Recent advances in pre-training deep Bidirectional Transformers (BERT) have significantly improved self-supervised learning tasks in computer vision. However, the standard BERT in vision problems is designed to learn only from full images or videos, and the architecture cannot accurately detect details of facial micro-expressions. This paper presents Micron-BERT ($μ$-BERT), a novel approach to facial micro-expression recognition. The proposed method can automatically capture these movements in an unsupervised manner based on two key ideas. First, we employ Diagonal Micro-Attention (DMA) to detect tiny differences between two frames. Second, we introduce a new Patch of Interest (PoI) module to localize and highlight micro-expression interest regions and simultaneously reduce noisy backgrounds and distractions. By incorporating these components into an end-to-end deep network, the proposed $μ$-BERT significantly outperforms all previous work in various micro-expression tasks. $μ$-BERT can be trained on a large-scale unlabeled dataset, i.e., up to 8 million images, and achieves high accuracy on new unseen facial micro-expression datasets. Empirical experiments show $μ$-BERT consistently outperforms state-of-the-art performance on four micro-expression benchmarks, including SAMM, CASME II, SMIC, and CASME3, by significant margins. Code will be available at \url{https://github.com/uark-cviu/Micron-BERT}

研究の動機と目的

  • 0.25〜0.5秒間の持続する微細で不随意の顔のマイクロエクスプレッションを認識する課題に取り組むこと。
  • 顔のランドマークやバウンディングボックスに依存せず、大規模なラベルなし動画データを活用できる自己教師付き学習フレームワークを開発すること。
  • 背景ノイズや他の干渉要因を除外し、局所的で高感受性な顔領域に注目することで、マイクロムーブメントの検出を向上させること。
  • 異なる文化的背景を持つ未観測の被験者を含む、複数の標準マイクロエクスプレッションベンチマークで最先端の性能を達成すること。

提案手法

  • 対応する2つの連続フレームのパッチ間のアテンションを計算する新規アテンション機構、対角的マイクロアテンション(DMA)を導入し、微細な動きの差を検出する。
  • マイクロエクスプレッションを含む顔領域を自己教師付きで特定・強調する「オーダーポイント(POI)」モジュールを提案し、背景ノイズへの感受性を低減する。
  • ブロックワイドスワッピングを用いた2フレーム対比的事前学習戦略を採用し、フレーム間の局所的マイクロ変動特徴を学習するようにモデルを促進する。
  • DMAとPOIをビジョントランスフォーマーベースに統合したエンドツーエンドの深層ネットワークを設計し、特徴の共同学習と局所化を可能にする。
  • 自己教師付き対比学習を用いて、CASME3データセットから最大800万枚のラベルなし画像を用いてモデルを事前学習する。
  • CASME II、SAMM、SMIC、CASME3などの標準ベンチマークを用いて、下流のマイクロエクスプレッション認識タスクで最終モデルを微調整する。

実験結果

リサーチクエスチョン

  • RQ1大規模なラベルなし動画データから顔のランドマークやバウンディングボックスに依存せずに、自己教師付きBERTベースのアーキテクチャがマイクロエクスプレッションパターンを効果的に学習できるか。
  • RQ2標準アテンション機構と比較して、対角的マイクロアテンション(DMA)は、フレーム間の顔の微細な動き差の検出をどの程度向上させるか。
  • RQ3オーダーポイント(POI)モジュールは、マイクロエクスプレッション認識の際、顔の感受性の高い領域に注目し背景ノイズをフィルタリングすることで、モデルのロバストネスをどの程度向上させるか。
  • RQ4提案された$\mu$-BERTフレームワークは、性別、年齢、民族的背景が異なる多様な被験者を含む未観測の被験者に対しても、良好に一般化できるか。
  • RQ5DMAとPOIモジュールの組み合わせは、標準マイクロエクスプレッションベンチマークで最先端の性能を達成するために、どのように寄与しているか。

主な発見

  • CASME IIベンチマークにおいて、Micron-BERTは89.03%の認識正確性を達成し、先行する最先端手法を大きく上回っている。
  • CASME3データセットでは、$\mu$-BERTは32.64%のUF1と32.54%のUARを達成し、大規模かつ多様なデータセットでも優れた性能を示している。
  • アブレーションスタディの結果、POIモジュールはベースラインからUARを最大6%向上させ、ノイズ抑制におけるその重要性が明確に示された。
  • DMAモジュール単体でも、ベースライン比でUARが4%向上し、フレーム間のマイクロムーブメントを捉える有効性が裏付けられた。
  • CASME3で事前学習したモデルは、未観測のデータセットにも良好に一般化し、異なる被験者や文化的背景のグループに対してもロバストであることが示された。
  • CASME3での自己教師付き事前学習は、下流タスクの性能を顕著に向上させ、MAEおよびMoCo V3はUF1とUARでそれぞれ3.5%および2%の向上を達成し、ImageNet事前学習済みViT-Sを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。