Skip to main content
QUICK REVIEW

[論文レビュー] Multi-scale multi-modal micro-expression recognition algorithm based on transformer

Fengping Wang, Jie Li|arXiv (Cornell University)|Jan 8, 2023
Advanced Computing and Algorithms被引用数 4
ひとこと要約

本稿では、マルチヘッド自己注意機構とクロスモodal対照学習を用いて、複数の空間スケールにわたる動きとテクスチャ特徴を統合する、トランスフォーマーに基づくマルチスケール・マルチモーダルな微表情認識アルゴリズムを提案する。SMICでは78.73%の正確度、CASMEII結合データセットでは0.9071のF1スコアを達成し、最先端の性能を示した。

ABSTRACT

A micro-expression is a spontaneous unconscious facial muscle movement that can reveal the true emotions people attempt to hide. Although manual methods have made good progress and deep learning is gaining prominence. Due to the short duration of micro-expression and different scales of expressed in facial regions, existing algorithms cannot extract multi-modal multi-scale facial region features while taking into account contextual information to learn underlying features. Therefore, in order to solve the above problems, a multi-modal multi-scale algorithm based on transformer network is proposed in this paper, aiming to fully learn local multi-grained features of micro-expressions through two modal features of micro-expressions - motion features and texture features. To obtain local area features of the face at different scales, we learned patch features at different scales for both modalities, and then fused multi-layer multi-headed attention weights to obtain effective features by weighting the patch features, and combined cross-modal contrastive learning for model optimization. We conducted comprehensive experiments on three spontaneous datasets, and the results show the accuracy of the proposed algorithm in single measurement SMIC database is up to 78.73% and the F1 value on CASMEII of the combined database is up to 0.9071, which is at the leading level.

研究の動機と目的

  • 微表情の持続時間が短く、顔面領域におけるスケールが多様であるため、その認識が困難であるという課題に対処すること。
  • 動きおよびテクスチャモダリティの両方で複数スケールにわたるマルチグレインの局所的特徴を捉えることで、特徴抽出を向上させること。
  • マルチヘッド自己注意機構を用いてマルチスケール特徴を統合することで、表現学習を強化すること。
  • 動きとテクスチャ埋め込みを整列させるために、クロスモダリティ対照学習を用いてモデルを最適化すること。
  • 自発的微表情認識ベンチマークで最先端の性能を達成すること。

提案手法

  • 本手法は、複数スケールで動きとテクスチャ特徴を別々に処理するデュアルストリーム・トランスフォーマー・アーキテクチャを採用する。
  • 両モダリティの異なる解像度における顔面領域からパッチレベルの特徴を抽出することで、マルチスケールの局所的パターンを捉える。
  • 各モダリティに多層多ヘッド自己注意を適用し、文脈的関係に基づいてパッチ特徴を重み付け・集約する。
  • 異なるスケールからの注意重みを統合することで、強化され、スケールに頑健な表現を生成する。
  • 動きとテクスチャの特徴空間を整列させるために、クロスモダリティ対照学習を用いることで、一般化性能および特徴品質を向上させる。
  • 最終的な特徴を統合し、エンドツーエンドで訓練された分類器ヘッドを用いて分類する。

実験結果

リサーチクエスチョン

  • RQ1複数スケール・複数モーダルなアプローチにより、顔面領域の異なる部分における細粒度の空間パターンを捉えることで、微表情認識が向上するか?
  • RQ2トランスフォーマーに基づくアーキテクチャは、微表情シーケンスにおける長距離依存性および文脈的関係をどの程度効果的にモデル化できるか?
  • RQ3クロスモダリティ対照学習は、動きとテクスチャモーダルティの間で特徴をどの程度整列させるか?
  • RQ4提案手法は、自発的微表情データセットにおいて、既存の最先端モデルを上回る性能を示すか?
  • RQ5マルチスケールパッチ特徴の統合は、認識正確度および耐性にどのような影響を及ぼすか?

主な発見

  • 提案手法は、自発的微表情データセットSMICで78.73%の正確度を達成し、先行手法を上回った。
  • 結合CASMEIIデータセットでは、F1スコアが0.9071に達し、多クラス認識において強力な性能を示した。
  • マルチスケールパッチ特徴の使用により、異なる空間解像度にわたる微かな顔面運動を捉える能力が顕著に向上した。
  • クロスモダリティ対照学習により、動きとテクスチャ埋め込みの整列が向上し、特徴の識別性が向上した。
  • スケール間でのマルチヘッド自己注意の統合により、より頑健で文脈に配慮した特徴表現が得られた。
  • ベンチマークデータセットにおいて、複数の評価指標で最先端の性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。