[論文レビュー] Short and Long Range Relation Based Spatio-Temporal Transformer for Micro-Expression Recognition
本論文は、光流の特徴量において短時間および長時間の空間的・時間的依存関係を同時にモデル化するための、最初の純粋なトランスフォーマー基盤アーキテクチャを提案する。このアーキテクチャは、最先端の性能を達成し、SMIC-HS、CASME II、SAMMの3つの主要データセットにおいて、すべてで0.9を超える未加重F1スコアを達成した最初の手法となった。
Being spontaneous, micro-expressions are useful in the inference of a person's true emotions even if an attempt is made to conceal them. Due to their short duration and low intensity, the recognition of micro-expressions is a difficult task in affective computing. The early work based on handcrafted spatio-temporal features which showed some promise, has recently been superseded by different deep learning approaches which now compete for the state of the art performance. Nevertheless, the problem of capturing both local and global spatio-temporal patterns remains challenging. To this end, herein we propose a novel spatio-temporal transformer architecture -- to the best of our knowledge, the first purely transformer based approach (i.e. void of any convolutional network use) for micro-expression recognition. The architecture comprises a spatial encoder which learns spatial patterns, a temporal aggregator for temporal dimension analysis, and a classification head. A comprehensive evaluation on three widely used spontaneous micro-expression data sets, namely SMIC-HS, CASME II and SAMM, shows that the proposed approach consistently outperforms the state of the art, and is the first framework in the published literature on micro-expression recognition to achieve the unweighted F1-score greater than 0.9 on any of the aforementioned data sets.
研究の動機と目的
- 微表情は一時的で低強度であり、自発的かつ無意識的であるため、検出が困難であるという課題に対処すること。
- 畳み込みニューラルネットワーク(CNN)が、微表情動画において局所的およびグローバルな空間的・時間的関係を同時に捉えることの限界を克服すること。
- 畳み込み演算を完全に置き換える純粋なトランスフォーマー基盤アーキテクチャを構築し、短時間および長時間の空間的・時間的依存関係をエンドツーエンドで学習可能にすること。
- 特に未加重F1スコアが分野における主要な課題のまま残っているが、ベンチマーク用微表情データセットで最先端の性能を達成すること。
提案手法
- モデルは、長期間の光流フレームからの空間的関係を学習するための、マルチヘッド自己注意に基づく空間エンコーダーを用い、畳み込み層を置き換える。
- 時間的集約ブロックは、シーケンストークン上の学習可能な注意メカニズムを用いて、動画フレーム間の長距離時間的依存関係をモデル化する。
- 視覚化された長期間の光流表現を処理することで、微表情検出に不可欠な運動ダイナミクスを保持する。
- エンドツーエンド学習および推論のため、トランスフォーマーエンコーダーの[CLS]トークン出力に分類ヘッドを適用する。
- 標準的な交差エントロピー損失と早期停止、Adam最適化を用いて学習を行い、単一データセットおよび複合データセットの両方の評価プロトコルで評価する。
- 被験者を1人ずつ除外する交差検証プロトコルを用いて、被験者間での耐性および一般化性能を確保する。
実験結果
リサーチクエスチョン
- RQ1短時間および長時間の空間的・時間的依存関係を統合的にモデル化することで、純粋なトランスフォーマー基盤アーキテクチャが畳み込みネットワークを上回る性能を発揮できるか?
- RQ2長期間の光流特徴量にマルチヘッド自己注意を適用することで、手作業特徴量やCNNベース特徴量と比較して認識性能が向上するか?
- RQ3提案手法が、標準的な微表情データセットのいずれかで未加重F1スコアが0.9を超えることができるか、新たな最先端性能を確立できるか?
- RQ4クラス分布が不均衡な状況下でも、単一データセットおよび複合データセットの両方の評価設定において、モデルの性能はどのように現れるか?
主な発見
- 提案手法は、SMIC-HS、CASME II、SAMMの3つのベンチマークデータセットにおいて、いずれのデータセットでも初めて報告された未加重F1スコアが0.9を超えた。
- CASME IIでは、評価されたすべての手法の中で最高の未加重F1スコアと、2番目の高い未加重正答率を達成した。
- 複合データベースでは、未加重F1スコアで1位、未加重正答率で2位を記録し、多様なデータソースにわたる強力な一般化性能を示した。
- GCNベースやハイブリッドCNN-Transformerモデルを含む、従来の最先端手法を上回り、微細な微表情の分類において特に優れた性能を示した。
- 混同行列の分析から、CASME IIにおける嫌悪(Disgust)と他の感情(Others)の区別、SAMMにおける軽蔑(Contempt)と喜び(Happiness)の区別に、継続的な課題が存在することが明らかになった。これは、主にデータセット内のAUラベルが一貫性がなかったり曖昧だったりするためである。
- アブレーションスタディにより、マルチヘッド自己注意機構が極めて重要であることが確認された。時間的集約ブロックを単純な平均演算子に置き換えると、性能が著しく低下した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。