[論文レビュー] OFF-ApexNet on Micro-expression Recognition System
本論文は、アピックスフレームとリファレンスオネセットフレームから抽出された光流跡特徴を活用することで、動きの表現を向上させる、新しいCNNベースのマイクロエクスプレッション認識フレームワーク、OFF-ApexNetを提案する。水平および垂直の光流跡入力を事前学習済みCNNに統合することで、マルチデータベース、1人飛ばしの交差検証において74.60%の正確性と71.04%のF-measureを達成し、SMIC、CASME II、SAMMデータセット間での初めてのクロスデータセット検証を実現した。
When a person attempts to conceal an emotion, the genuine emotion is manifest as a micro-expression. Exploration of automatic facial micro-expression recognition systems is relatively new in the computer vision domain. This is due to the difficulty in implementing optimal feature extraction methods to cope with the subtlety and brief motion characteristics of the expression. Most of the existing approaches extract the subtle facial movements based on hand-crafted features. In this paper, we address the micro-expression recognition task with a convolutional neural network (CNN) architecture, which well integrates the features extracted from each video. A new feature descriptor, Optical Flow Features from Apex frame Network (OFF-ApexNet) is introduced. This feature descriptor combines the optical ow guided context with the CNN. Firstly, we obtain the location of the apex frame from each video sequence as it portrays the highest intensity of facial motion among all frames. Then, the optical ow information are attained from the apex frame and a reference frame (i.e., onset frame). Finally, the optical flow features are fed into a pre-designed CNN model for further feature enhancement as well as to carry out the expression classification. To evaluate the effectiveness of OFF-ApexNet, comprehensive evaluations are conducted on three public spontaneous micro-expression datasets (i.e., SMIC, CASME II and SAMM). The promising recognition result suggests that the proposed method can optimally describe the significant micro-expression details. In particular, we report that, in a multi-database with leave-one-subject-out cross-validation experimental protocol, the recognition performance reaches 74.60% of recognition accuracy and F-measure of 71.04%. We also note that this is the first work that performs cross-dataset validation on three databases in this domain.
研究の動機と目的
- 低強度および短時間であるがゆえに検出が困難な微細で短時間のマイクロエクスプレッションを認識する課題に対処すること。
- 従来のハンドクラフト特徴の限界を克服し、動きの表現を向上させるために、光流跡とディープラーニングを統合すること。
- 複数の自発的マイクロエクスプレッションデータベースにわたるクロスデータセット一般化を可能にする統一されたフレームワークを開発すること。
- 顔面の動き強度が最大となるアピックスフレームに注目することで、分類性能を向上させること。
- これまでの文献で未踏であったマイクロエクスプレッション認識におけるクロスデータセット評価のベンチマークを確立すること。
提案手法
- フレーム単位の動きエネルギー計算を用いて、各動画シーケンスにおけるアピックスフレーム(顔面の動き強度が最大となるフレーム)を特定する。
- アピックスフレームとリファレンスオネセットフレームの間で、水平方向(u)および垂直方向(v)の光流跡成分を計算し、動きのダイナミクスを捉える。
- uおよびvの光流跡特徴を1つの入力テンソルに統合することで、空間的・時間的動きの文脈を保持する。
- 統合された光流跡特徴を、階層的特徴学習と表現分類のための事前設計済み畳み込みニューラルネットワーク(CNN)に供給する。
- 確率的勾配降下法を用いて、交差エントロピー損失を最適化し、6つの感情に対する多クラス分類を目的として、CNNをエンドツーエンドで訓練する。
- 3つの公開データセット(SMIC、CASME II、SAMM)における1人飛ばしの交差検証を用いて、性能を評価する。
実験結果
リサーチクエスチョン
- RQ1アピックスフレームから抽出した光流跡特徴は、従来のハンドクラフト特徴と比較してマイクロエクスプレッション認識の正確性を向上させるか?
- RQ2水平方向および垂直方向の両方の光流跡成分を統合することで、動きの表現および分類性能が向上するか?
- RQ3提案されたOFF-ApexNetモデルは、ドメイン特化のファインチューニングなしに、複数の自発的マイクロエクスプレッションデータベースに一般化可能か?
- RQ4マルチデータベース交差検証において、最高のパフォーマンスを達成する最適な訓練エポック数は何か?
- RQ5特に予測度が低いとされる「驚き」などの未代表的クラスにおいて、モデルはどのように性能を示すか?
主な発見
- OFF-ApexNetは、3つのデータベース(SMIC、CASME II、SAMM)を対象とした1人飛ばしのプロトコルで、認識正確性74.60%、F-measure 71.04%を達成した。
- 単一成分の光流跡入力(uまたはv)よりも優れた性能を示し、u+vの統合では3000エポックで74.60%の正確性を達成したのに対し、uでは66.21%、vでは65.31%であった。
- 3000エポックで最高の正確性(74.60%)が達成され、4000および5000エポックではわずかに性能が低下したため、この点以降に過学習の兆候が見られた。
- 否定的感情は、3つのデータセットのトレーニングデータにわたる優位性から、予測率が最も高かった(統合混同行列で84%)。
- SAMMデータセットでは、「驚き」の分類正確性が47%にとどまり、全クラス中最も低く、微細または弱い強度の表現を認識する課題が示された。
- 本研究は、SMIC、CASME II、SAMMの間で初めてクロスデータセット検証を実施し、マイクロエクスプレッション認識における一般化性能の新しいベンチマークを確立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。