[論文レビュー] A Multi-stream Convolutional Neural Network for Micro-expression Recognition Using Optical Flow and EVM
本稿では、微表情認識のためのマルチストリーム畳み込みニューラルネットワーク(MSCNN)を提案する。このモデルは、光学フロー、Eulerian Video Magnification(EVM)で強化された顔面運動、およびマスク処理を施したグレースケール画像を融合する。EVMによる運動強調、光学フローによる動的運動パターン抽出、マスクベースの局所的特徴抽出を組み合わせることで、CASME-II(43.04%の正確性、0.3569のF1スコア)およびSAMM(40.71%の正確性、0.3173のF1スコア)で最先端の性能を達成。ランダムオーバーサンプリングにより、クラス不均衡の影響が軽減された。
Micro-expression (ME) recognition plays a crucial role in a wide range of applications, particularly in public security and psychotherapy. Recently, traditional methods rely excessively on machine learning design and the recognition rate is not high enough for its practical application because of its short duration and low intensity. On the other hand, some methods based on deep learning also cannot get high accuracy due to problems such as the imbalance of databases. To address these problems, we design a multi-stream convolutional neural network (MSCNN) for ME recognition in this paper. Specifically, we employ EVM and optical flow to magnify and visualize subtle movement changes in MEs and extract the masks from the optical flow images. And then, we add the masks, optical flow images, and grayscale images into the MSCNN. After that, in order to overcome the imbalance of databases, we added a random over-sampler after the Dense Layer of the neural network. Finally, extensive experiments are conducted on two public ME databases: CASME II and SAMM. Compared with many recent state-of-the-art approaches, our method achieves more promising recognition results.
研究の動機と目的
- 微表情の持続時間が短く、強度が低く、顔面の動きが微細なため、認識正確性が低いという問題に対処すること。
- 深層学習モデルにおける微表情認識の限界、特に特徴表現の悪さとデータセットのクラス不均衡の問題を克服すること。
- EVMによる運動強調と光学フローによる動的運動パターン抽出を組み合わせることで、特徴抽出を向上させること。
- マルチストリームCNNアーキテクチャを用いて、静的・動的・局所的顔面特徴を統合することで、モデルの汎化性能を向上させること。
- ネットワークの最終全結合層の直後に挿入されたランダムオーバーサンプラーを用いて、クラス不均衡を緩和すること。
提案手法
- 微表情における微細な顔面運動を強調するために、最適な増幅係数α = 8を用いたEulerian Video Magnification(EVM)を適用する。
- 顔面筋の変化の運動パターンを捉えるために、Liuら[9]の手法を用いて光学フローを計算する。
- 光学フロー画像から閾値50を用いて二値マスクを生成し、顕著な運動を示す領域を分離する。
- MSCNNに3つの入力ストリームを供給する:元のグレースケール画像(静的)、光学フロー画像(動的)、マスク処理を施したグレースケール画像(局所的運動領域)。
- CASME-IIおよびSAMMデータベースのクラス不均衡に対処するために、最終全結合層の直後にランダムオーバーサンプラーを挿入する。
- マルチストリームCNNアーキテクチャにより、静的・動的・局所的運動表現の特徴統合が可能となり、分類性能が向上する。
実験結果
リサーチクエスチョン
- RQ1EVMと光学フローを組み合わせることで、微細な微表情の動きの検出性が向上するか?
- RQ2全フレーム入力と比較して、マスク処理を施した局所的運動特徴の統合は認識性能を向上させるか?
- RQ3深層ニューラルネットワークアーキテクチャ内に挿入されたランダムオーバーサンプラーは、微表情データベースにおけるクラス不均衡の緩和にどの程度効果的か?
- RQ4提案されたマルチストリームCNNは、CASME-IIおよびSAMMにおいて、シングルストリームおよびダブルストリームベースラインを上回る性能を示すか?
- RQ5微表情データセットにおける認識正確性を最大化する最適なEVM増幅係数αは何か?
主な発見
- 提案されたMSCNNは、SAMMデータベースで43.04%の正確性と0.3569のF1スコアを達成し、既存手法(HOOF:42.17%の正確性、HOG3D:34.16%の正確性)を上回った。
- CASME-IIでは、40.71%の正確性と0.3173のF1スコアを達成し、LBP-TOP(35.56%の正確性)および他の最先端手法と比較して優れた性能を示した。
- 最適なEVM増幅係数はα = 8であり、CASME-IIおよびSAMMの両データセットで認識性能を最大化した。
- ランダムオーバーサンプラーの追加によりCASME-IIでの性能が向上したが、SAMMではやや不利な影響を及ぼした可能性がある。これは、同データセットがより小さく、ノイズが多いことによるものと考えられる。
- 静的・動的・局所的運動特徴を統合したマルチストリームアーキテクチャは、両データベースにおいて、シングルストリームやダブルストリームベースラインよりも優れた結果をもたらした。
- 混同行列の分析から、モデルはCASME-IIおよびSAMMの5つの主要な感情クラス(嫌悪、喜び、抑圧、驚き、その他)を効果的に区別できていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。