Skip to main content
QUICK REVIEW

[論文レビュー] SMA-STN: Segmented Movement-Attending Spatiotemporal Network forMicro-Expression Recognition

Jiateng Liu, Wenming Zheng|arXiv (Cornell University)|Oct 19, 2020
Human Pose and Action Recognition参考文献 30被引用数 7
ひとこと要約

本論文は、微表情認識(MER)を向上させるために、動的セグメント化スパースイメージングモジュール(DSSI)とセグメント化された動きに注目するモジュール(STMA)を備えた新規な時空間ネットワークSMA-STNを提案する。この手法は微細な動きの変化を捉え、重要な時間的セグメントに注目することで、顔の微細な動きの変化を強調する。DE-Loss(乖離強化損失)を用いることで、微細な動きの差を拡大し、SOTA性能を達成した。SMIC-HSデータセットにおいて77.44%の正確性と0.7683のF1スコアを記録し、従来手法を大きく上回った。

ABSTRACT

Correctly perceiving micro-expression is difficult since micro-expression is an involuntary, repressed, and subtle facial expression, and efficiently revealing the subtle movement changes and capturing the significant segments in a micro-expression sequence is the key to micro-expression recognition (MER). To handle the crucial issue, in this paper, we firstly propose a dynamic segmented sparse imaging module (DSSI) to compute dynamic images as local-global spatiotemporal descriptors under a unique sampling protocol, which reveals the subtle movement changes visually in an efficient way. Secondly, a segmented movement-attending spatiotemporal network (SMA-STN) is proposed to further unveil imperceptible small movement changes, which utilizes a spatiotemporal movement-attending module (STMA) to capture long-distance spatial relation for facial expression and weigh temporal segments. Besides, a deviation enhancement loss (DE-Loss) is embedded in the SMA-STN to enhance the robustness of SMA-STN to subtle movement changes in feature level. Extensive experiments on three widely used benchmarks, i.e., CASME II, SAMM, and SHIC, show that the proposed SMA-STN achieves better MER performance than other state-of-the-art methods, which proves that the proposed method is effective to handle the challenging MER problem.

研究の動機と目的

  • 微表情の持つ短時間、低強度、高フレーム類似性のため、認識が困難であるという課題に対処すること。
  • 類似した隣接フレームに起因する冗長性を低減しつつ、重要な動きの情報を保持すること。
  • 長距離の空間的依存関係を効果的に捉え、情報量の多い時間的セグメントに重みを割り当てる、堅牢なディープラーニングフレームワークの構築。
  • 新規な損失関数を用いて、微細な動きの変化に対する特徴レベルの耐性を高めること。

提案手法

  • 独自のプロトコルに従い、微表情シーケンスから4つの異なるセグメントをサンプリングし、動的画像を計算することで、時空間的動きのパターンを表現する、動的セグメント化スパースイメージング(DSSI)モジュールを提案。
  • CNNバックボーンと時空間的動きに注目する(STMA)モジュールを備えた、セグメント化された動きに注目する時空間ネットワーク(SMA-STN)を導入。STMAは空間領域および時間的セグメントにわたる注目重みを学習する。
  • STMAに二重注目メカニズムを組み込む:シーケンスレベルの文脈を捉えるためのグローバル自己注意モジュールと、顔領域間の長距離空間的依存関係をモデル化する非局所自己注意ブロック。
  • 異なるセグメントからの特徴間のユークリッド距離を最大化することで、特徴表現を正則化するデバイエーション強化損失(DE-Loss)を導入。これにより、微細な動きの差に敏感になる。
  • トレーニング中に交差エントロピー損失とDE-Lossをバランスさせるためのトレードオフ係数λを用い、分類の正確性と動きの識別性能の両方を最適化。
  • DSSIで独自のサンプリングプロトコルを採用し、1シーケンスあたり4セットの3枚画像動的画像を生成することで、効率的かつ代表的な時空間的特徴抽出を実現。

実験結果

リサーチクエスチョン

  • RQ1微表情シーケンスをどのように効率的にサンプリングすれば、冗長性を低減しつつ、重要な動きダイナミクスを保持できるか?
  • RQ2二重注目メカニズムは、微表情シーケンスにおける長距離の空間的および時間的依存関係を効果的にモデル化できるか?
  • RQ3新規な損失関数は、セグメント間の微細な動きの変化を区別する能力をどの程度向上できるか?
  • RQ4DSSI、STMA、DE-Lossという提案されたモジュールが、どのように連携してMER性能を向上させるか?
  • RQ5DE-Lossのハイパーパrameterλを最適化することで、分類と動き強化の間で達成可能な最適なトレードオフは何か?

主な発見

  • SMA-STNはSMIC-HSデータセットで77.44%の認識正確性と0.7683のF1スコアを達成し、従来のSOTA手法TSCNN-Iを正確性で4.70ポイント、F1スコアで0.0447上回った。
  • アブレーションスタディにより、STMAおよびDE-Lossモジュールの両方が性能向上に顕著に寄与していることが確認され、完全モデル(実験4)はベースライン(実験1)比で77.44%の正確性を達成し、3.66%の向上を示した。
  • SMIC-HSにおいてDE-Lossの最適なトレードオフパラメータλは0.03であると判明。これは、動きの識別性能と分類性能の両方を効果的にバランスさせる。
  • 注目重み(α)の可視化により、SMA-STNが微細な動き情報が豊富な動的画像に高い重要性を割り当てていることが確認され、顕著なセグメントに注目できる能力を有していることが裏付けられた。
  • DE-Loss関数は、セグメント間の特徴差を効果的に拡大し、特徴空間における微細な動きの変動に対して耐性を高める効果を示した。
  • CASME II、SAMM、SMICの3つのベンチマークにおける広範な実験により、SMA-STNが従来のSOTA手法を正確性およびF1スコアの両面で一貫して上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。