[論文レビュー] Video-based Facial Expression Recognition using Graph Convolutional Networks
本論文は、動画ベースの顔の感情認識のための新しいグラフ畳み込みネットワーク(GCN)を統合したCNN-RNNフレームワーク、FER-GCNを提案する。GCNを用いてピーク表現フレームからの特徴を動画フレーム全体に伝達し、学習された隣接行列を用いて特徴を重み付けすることで、動的な高強度の表情領域に注目する。CK+、Oulu-CASIA、MMI、および挑戦的なAFEW8.0データセットにおいて、最先端の性能を達成した。
Facial expression recognition (FER), aiming to classify the expression present in the facial image or video, has attracted a lot of research interests in the field of artificial intelligence and multimedia. In terms of video based FER task, it is sensible to capture the dynamic expression variation among the frames to recognize facial expression. However, existing methods directly utilize CNN-RNN or 3D CNN to extract the spatial-temporal features from different facial units, instead of concentrating on a certain region during expression variation capturing, which leads to limited performance in FER. In our paper, we introduce a Graph Convolutional Network (GCN) layer into a common CNN-RNN based model for video-based FER. First, the GCN layer is utilized to learn more significant facial expression features which concentrate on certain regions after sharing information between extracted CNN features of nodes. Then, a LSTM layer is applied to learn long-term dependencies among the GCN learned features to model the variation. In addition, a weight assignment mechanism is also designed to weight the output of different nodes for final classification by characterizing the expression intensities in each frame. To the best of our knowledge, it is the first time to use GCN in FER task. We evaluate our method on three widely-used datasets, CK+, Oulu-CASIA and MMI, and also one challenging wild dataset AFEW8.0, and the experimental results demonstrate that our method has superior performance to existing methods.
研究の動機と目的
- 動的な表情変化の過程で、既存の動画ベースFER手法が一貫して重要な顔領域に注目できないという限界に対処すること。
- GCNを用いた特徴伝搬を統合することで、顔の表情における長期的な時系列的依存関係を改善すること。
- GCNから得た隣接行列を用いて、ピーク表現フレームを自動で特定・強調することで、分類性能を向上させること。
- 動画シーケンス全体で最も表現的な顔領域に集中することで、特徴表現を強化する、堅牢でエンドツーエンドのフレームワークを開発すること。
提案手法
- メッセージ伝達を通じて動的な表情領域に強化された注目をもつフレームベース特徴を学習するため、CNNとLSTMの間にGCN層を統合する。
- フレーム間の依存関係をモデル化するため、GCNで学習可能な隣接行列を用い、ピーク表現フレームからの特徴を強調する。
- 学習された隣接行列に基づく重み付き特徴統合関数を適用し、高強度フレームからの情報的特徴を優先する。
- 空間的特徴抽出のためのバックボーンとしてVGG16を用い、その後にGCNを用いた空間的・時系列的特徴の最適化を実施する。
- GCNの後続にLSTMを配置し、最適化された領域に注目した特徴の長期的な時系列的ダイナミクスをモデル化する。
- シグモイド関数を用いて隣接行列の重みを正規化し、表情の強度を表現するとともに、ピークフレームへの注目を誘導する。
実験結果
リサーチクエスチョン
- RQ1GCNを用いた特徴伝搬は、動画シーケンスにおける動的な顔の表情変化のモデリングを改善できるか?
- RQ2GCNからデータ駆動型の隣接行列を学習することで、ピーク表現フレームを特定・強調し、認識性能を向上させられるか?
- RQ3表情強度に基づくGCNで学習された特徴の重み付き統合は、標準的な特徴平均化よりも分類精度を向上させられるか?
- RQ4提案されたFER-GCNフレームワークは、制御下およびリアルワールドの顔の感情認識データセットにおいて、最先端の手法と比較してどのように性能を発揮するか?
主な発見
- CK+では99.54%の精度を達成し、ベースラインのVGG16(97.78%)を顕著に上回った。
- Oulu-CASIAでは91.04%の精度を達成し、ベースラインより5.21%、VGG-Face-LSTMより2.71%の向上を示した。
- 挑戦的なAFEW8.0ワイルドデータセットでは55.67%の精度を達成し、Emotiw2018で最高の単一モデル(53.91%)を1.76%上回った。
- アブレーションスタディの結果、2層のGCNが最適な性能を発揮することが確認され、より深いスタックは過剰平滑化を引き起こし、性能低下をもたらした。
- 重み付き特徴統合機構により、CK+、Oulu-CASIA、MMIそれぞれで0.45%、1.25%、1.25%の追加精度向上が得られた。
- 隣接行列の可視化により、表情強度と一貫した整合性が確認され、全データセットで最も表現的なフレームで重みがピークに達した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。