[論文レビュー] Evaluation of the Spatio-Temporal features and GAN for Micro-expression Recognition System
本稿では、微表情認識のための修正された3ストリームCNNアーキテクチャに、空間的・時間的光流特徴とGANベースのデータ拡張を組み合わせた手法を提案する。5種類の光流手法(RLOF、TVL1、Farneback、Lucas-Kanade、Horn-Schunck)と2種類のGAN変種(AC-GAN、SAGAN)を評価し、特徴表現の向上とデータ不足の緩和を図り、p&q&ε入力設定でSMICデータセットにおいて最高71.20%の正確性と68.31%のF1スコアを達成した。
Owing to the development and advancement of artificial intelligence, numerous works were established in the human facial expression recognition system. Meanwhile, the detection and classification of micro-expressions are attracting attentions from various research communities in the recent few years. In this paper, we first review the processes of a conventional optical-flow-based recognition system, which comprised of facial landmarks annotations, optical flow guided images computation, features extraction and emotion class categorization. Secondly, a few approaches have been proposed to improve the feature extraction part, such as exploiting GAN to generate more image samples. Particularly, several variations of optical flow are computed in order to generate optimal images to lead to high recognition accuracy. Next, GAN, a combination of Generator and Discriminator, is utilized to generate new "fake" images to increase the sample size. Thirdly, a modified state-of-the-art Convolutional neural networks is proposed. To verify the effectiveness of the the proposed method, the results are evaluated on spontaneous micro-expression databases, namely SMIC, CASME II and SAMM. Both the F1-score and accuracy performance metrics are reported in this paper.
研究の動機と目的
- 複数の光流手法を用いた空間的・時間的特徴抽出の向上を通じて、微表情認識の正確性を向上させること。
- AC-GANとSAGANを用いたGANベースのデータ拡張により、微表情データセットのデータ不足とクラス不均衡問題に対処すること。
- 光流成分を統合する改良型3ストリームCNNアーキテクチャ(OFF-ApexNet)を構築し、より優れた特徴学習と分類を実現すること。
- 異なる光流入力とGAN生成データの有効性を、ベンチマーク用微表情データベース(SMIC、CASME II、SAMM)で評価すること。
- 訓練エポックごとの特徴埋め込みを主成分分析(PCA)で可視化し、モデルの訓練ダイナミクスを分析すること。
提案手法
- 顔映像シーケンスから空間的・時間的特徴を抽出するために、5種類の光流手法(RLOF、TVL1、Farneback、Lucas-Kanade、Horn-Schunck)を計算する。
- 3つの入力を光流成分(p、q、ρ、θ、ε、εux、εuy)の組み合わせとする修正された3ストリームCNNアーキテクチャを提案し、特徴マップを連結するのではなく乗算する。
- AC-GANとSAGANを用いて合成された微表情画像を生成し、訓練データのサイズを拡大し、クラス分布のバランスを改善する。
- 修正されたOFF-ApexNetは、交差エントロピー損失とAdam最適化を用いて、SMIC、CASME II、SAMMデータセットでエンドツーエンドに訓練される。
- 訓練エポックの途中で主成分分析(PCA)を適用し、特徴のクラスタリング状態と訓練の進行状況を可視化する。
- 認識性能は、異なる入力設定とGAN拡張を用いた場合に、すべての3つのデータセットで正確性とF1スコアを用いて評価される。
実験結果
リサーチクエスチョン
- RQ1RLOF、TVL1、Farneback、Lucas-Kanade、Horn-Schunckの中から、微表情分類の認識正確性が最も高い光流手法はどれか?
- RQ2ρ、θ、εux、εuyなどの追加光流成分の導入は、3ストリームCNNアーキテクチャの性能にどのように影響するか?
- RQ3AC-GANとSAGANは、小規模で不均衡な微表情データセットにおいて、認識性能をどの程度向上させるか?
- RQ4PCAを用いた学習済み埋め込みの可視化により、訓練中に特徴空間はどのように変化するか?
- RQ5特徴乗算を用いた修正された3ストリームCNNは、標準的な連結ベースの特徴統合に比べて、微表情認識で優れた性能を示すか?
主な発見
- p&q&ε設定がSMICデータセットで最高71.20%の正確性と68.31%のF1スコアを達成し、他の入力組み合わせを上回った。
- 5種類の光流手法の中で、TVL1とRLOFが最も一貫した性能を示し、特にTVL1がほとんどの設定で最良の結果を出した。
- AC-GANとSAGANは訓練サンプル数を効果的に増やし、データの不均衡を緩和し、一般化性能の向上に寄与した。
- エポック600でのPCA可視化では、感情クラスごとに明確な特徴クラスタリングが観察され、効果的な特徴学習と分離が行われたことが示された。
- 特徴乗算を用いた改良型OFF-ApexNetは、標準的な連結ベースの統合よりも優れた性能を示した。特に、大きさと方向成分を組み合わせた場合に顕著であった。
- すべてのデータセットにおける最高正確性は、SMICで71.20%であり、CASME IIとSAMMはそれぞれ68.71%および68.48%の正確性を最適設定で達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。