[論文レビュー] Feature refinement: An expression-specific feature learning and fusion method for micro-expression recognition
本稿では、アテンションベースのプロポーザルモジュールを用いて表現固有の特徴を学習し、それらを統合することで分類性能を向上させる、微表情認識を向上させるための深層学習フレームワークである特徴精錬(FR)を提案する。3段階のプロセス(2ストリームInceptionネットワークによる共有特徴学習、アテンションとプロポーザル損失を用いた表現固有特徴の蒸留、最終予測のための要素ごとの特徴統合)を経て、3つの公開ベンチマークで最先端または競争力のある性能を達成している。
Micro-Expression Recognition has become challenging, as it is extremely difficult to extract the subtle facial changes of micro-expressions. Recently, several approaches proposed several expression-shared features algorithms for micro-expression recognition. However, they do not reveal the specific discriminative characteristics, which lead to sub-optimal performance. This paper proposes a novel Feature Refinement ({FR}) with expression-specific feature learning and fusion for micro-expression recognition. It aims to obtain salient and discriminative features for specific expressions and also predict expression by fusing the expression-specific features. FR consists of an expression proposal module with attention mechanism and a classification branch. First, an inception module is designed based on optical flow to obtain expression-shared features. Second, in order to extract salient and discriminative features for specific expression, expression-shared features are fed into an expression proposal module with attention factors and proposal loss. Last, in the classification branch, labels of categories are predicted by a fusion of the expression-specific features. Experiments on three publicly available databases validate the effectiveness of FR under different protocol. Results on public benchmarks demonstrate that our FR provides salient and discriminative information for micro-expression recognition. The results also show our FR achieves better or competitive performance with the existing state-of-the-art methods on micro-expression recognition.
研究の動機と目的
- 微表情は持続時間が短く、強度が低いため、検出が困難であるが、そのような微細な表情から顕著で判別力のある特徴を抽出する課題に対処すること。
- 既存の表現共有特徴手法では、表現固有の判別パターンを捉えられず、その限界を克服すること。
- 自動的に表現固有の特徴を学習・統合することで、微表情認識の性能を向上させるエンドツーエンドの深層学習フレームワークの構築。
- 特徴の判別力とモデルの解釈可能性を向上させるために、新しいアテンション機構とプロポーザル損失の導入。
- 複数の標準評価プロトコルを用いた、公開データベース上での提案手法の有効性の検証。
提案手法
- 光流の入力を用いて、Inceptionブロックを備えた2ストリームInceptionネットワークにより、全身的および局所的な動きパターンを捉える表現共有特徴を抽出する。
- アテンション機構を備えた表現プロポーザルモジュールを適用し、判別性の高い領域を強調することで、共有特徴を表現固有の表現に精錬する。
- 異なる表現に対して特徴マップが明確に分離され、重複しないようにするため、特徴学習を最適化するためのプロポーザル損失を導入する。
- 表現固有の特徴を要素ごとの和集合により統合し、分類性能を向上させる精錬済み特徴を形成する。
- 分類ブランチは、統合済みの表現精錬特徴を用いて表現カテゴリを予測し、エンドツーエンド学習を可能にする。
- フレームワークは3つの評価設定(単一データベース(LOSO)、クロスデータベース(CDMER)、クロスデータセット(CDMER))で評価される。
実験結果
リサーチクエスチョン
- RQ1表現固有の特徴学習は、微表情認識における特徴の判別力を向上させるか?
- RQ2アテンションベースのプロポーザルモジュールは、微表情における微細で表現固有の顔面変化を効果的に強調できるか?
- RQ3表現固有の特徴を統合することで、共有特徴のみを用いる場合と比較して分類性能が向上するか?
- RQ4提案された特徴精錬フレームワークは、異なる評価プロトコルおよびデータベースでどのように性能を発揮するか?
- RQ5提案手法は、標準的な微表情認識ベンチマークで最先端の性能を達成できるか?
主な発見
- 提案されたFRフレームワークは、3つの公開微表情データベース(SMIC-HS、CASME II、SAMM)で最先端または競争力のある性能を達成した。
- LOSOプロトコル下でのSMIC-HSデータセットでは、FRは87.80%の正確度、86.50%のUAR、86.70%のUF1を達成した。
- CASME II(4クラス)では、LOSO評価下で85.82%の正確度、84.70%のUAR、84.90%のUF1を達成した。
- SAMMでは、LOSOプロトコル下で83.02%の正確度、81.50%のUAR、81.70%のUF1を達成し、優れた一般化性能を示した。
- クロスデータセット評価(CDMER)では、12のすべてのソース・ターゲットサブ実験で安定した性能を示し、ドメイン一般化能力の高さを裏付けた。
- アブレーションスタディの結果、アテンション機構とプロポーザル損失の両方が性能向上に顕著な寄与をしていることが確認され、設計選択の妥当性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。