Skip to main content
QUICK REVIEW

[論文レビュー] Spatiotemporal Recurrent Convolutional Networks for Recognizing Spontaneous Micro-expressions

Zhaoqiang Xia, Xiaopeng Hong|arXiv (Cornell University)|Jan 15, 2019
Human Pose and Action Recognition参考文献 56被引用数 17
ひとこと要約

本稿では、外見ベースの(STRCN-A)と幾何ベースの(STRCN-G)の2種類の時間的接続性を用いて空間的・時間的変形をモデル化することで、自発的マイクロエクスプレッションの自動認識を目的とした時空間再帰的畳み込みネットワーク(STRCN)を提案する。この手法は、限られたおよび不均衡な訓練データに対処するため、時間的データ拡張とバランス損失を統合しており、3つのベンチマークデータセットで最先端の性能を達成している。特に、LOVO評価プロトコルではSTRCN-Aが、LOSO評価プロトコルではSTRCN-Gが他の手法を上回った。

ABSTRACT

Recently, the recognition task of spontaneous facial micro-expressions has attracted much attention with its various real-world applications. Plenty of handcrafted or learned features have been employed for a variety of classifiers and achieved promising performances for recognizing micro-expressions. However, the micro-expression recognition is still challenging due to the subtle spatiotemporal changes of micro-expressions. To exploit the merits of deep learning, we propose a novel deep recurrent convolutional networks based micro-expression recognition approach, capturing the spatial-temporal deformations of micro-expression sequence. Specifically, the proposed deep model is constituted of several recurrent convolutional layers for extracting visual features and a classificatory layer for recognition. It is optimized by an end-to-end manner and obviates manual feature design. To handle sequential data, we exploit two types of extending the connectivity of convolutional networks across temporal domain, in which the spatiotemporal deformations are modeled in views of facial appearance and geometry separately. Besides, to overcome the shortcomings of limited and imbalanced training samples, temporal data augmentation strategies as well as a balanced loss are jointly used for our deep network. By performing the experiments on three spontaneous micro-expression datasets, we verify the effectiveness of our proposed micro-expression recognition approach compared to the state-of-the-art methods.

研究の動機と目的

  • マイクロエクスプレッションの持続時間が短く、空間的・時間的変化が微細であるため、その認識に課題が生じるという点を解決すること。
  • 手作業で設計された特徴量や浅い分類器がマイクロエクスプレッションの変形を捉えるのに限界を示すという点を克服すること。
  • 手動による設計なしに、時空間的特徴量を自動で学習する深層学習フレームワークを構築すること。
  • 限られたおよび不均衡なマイクロエクスプレッションの訓練サンプルによって引き起こされる性能低下を軽減すること。
  • 時間的接続性と頑健な損失関数を用いたエンドツーエンド学習により、認識精度を向上させること。

提案手法

  • 外見モデリングを目的としたSTRCN-Aと、光学フローを用いた幾何的運動モデリングを目的としたSTRCN-Gの2つの変種を提案する。
  • 時間軸に跨る畳み込みネットワークの接続性を再帰的接続を用いて拡張し、動的顔面変化を時系列データでモデル化する。
  • 時間的データ拡張を用いて、合成動画シーケンスの生成により有効な訓練サンプルを増加させる。
  • カテゴリ分布が不均衡なデータセットにおけるクラスの不均衡を緩和するため、バランス損失関数を導入する。
  • 手動による特徴量設計なしに、特徴抽出と分類の最適化を同時に実行するエンドツーエンド学習を採用する。
  • 特徴マップの拡張と再帰層のスタッキングを実施し、表現能力を向上させるが、過学習のリスクを監視する。

実験結果

リサーチクエスチョン

  • RQ1再帰的畳み込みネットワークは、自発的マイクロエクスプレッションに見られる微細な空間的・時間的変形を効果的にモデル化できるか?
  • RQ2外見ベースの(STRCN-A)と幾何ベースの(STRCN-G)の時間的接続性の違いが、認識性能にどのように影響するか?
  • RQ3時間的データ拡張とバランス損失は、小規模で不均衡なデータセットにおいて、モデルの一般化性能をどの程度向上させるか?
  • RQ4性能と計算コストのバランスを考慮した場合、最適な再帰層の数と特徴マップの数は何か?
  • RQ5LOVOおよびLOSO評価プロトコルの両方において、提案手法は最先端手法と比較してどのように差をつけるか?

主な発見

  • STRCN-Aは、LOVOプロトコル下でSMICデータセットにおいて88.9%の最高精度を達成し、先行する最先端手法を上回った。
  • STRCN-Gは、LOSOプロトコル下でCASME IIデータセットにおいて86.7%の最高性能を記録し、未観測の被験者への一般化能力が優れていた。
  • 時間的データ拡張とバランス損失の組み合わせにより、3つのデータセットすべてで一貫した性能向上が見られ、特にリソースが限られた環境下で顕著だった。
  • パcentileベースのマスキングによる過剰なピクセルの破棄(p < 0.5)が性能低下を引き起こしたため、最適なマイクロエクスプレッションに特化した領域選択は中程度のp値で達成されるべきであることが示された。
  • 特徴マップの数を増やすことで認識精度は向上したが、1層あたり64マップを超えると効果が薄れ、趨勢が鈍化した。
  • SMICデータセットでは、4層を超える再帰層の追加が性能低下を引き起こしたため、データの可用性に応じてモデルの深さを制限する必要があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。