[論文レビュー] Learning Vision Transformer with Squeeze and Excitation for Facial Expression Recognition
この研究は、顔表情認識のためにVision TransformerにSqueeze and Excitationブロックを組み込み、FER-2013で事前学習を行い、CK+とSFEWで単一モデルの最先端の結果を達成し、JAFFEとRAF-DBで競争力のある結果を示す。
As various databases of facial expressions have been made accessible over the last few decades, the Facial Expression Recognition (FER) task has gotten a lot of interest. The multiple sources of the available databases raised several challenges for facial recognition task. These challenges are usually addressed by Convolution Neural Network (CNN) architectures. Different from CNN models, a Transformer model based on attention mechanism has been presented recently to address vision tasks. One of the major issue with Transformers is the need of a large data for training, while most FER databases are limited compared to other vision applications. Therefore, we propose in this paper to learn a vision Transformer jointly with a Squeeze and Excitation (SE) block for FER task. The proposed method is evaluated on different publicly available FER databases including CK+, JAFFE,RAF-DB and SFEW. Experiments demonstrate that our model outperforms state-of-the-art methods on CK+ and SFEW and achieves competitive results on JAFFE and RAF-DB.
研究の動機と目的
- データが限られたFERデータセットでVision Transformer (ViT) を軽量なSEブロックで強化することによりFERを改善する。
- FERデータベース(CK+、JAFFE、RAF-DB、SFEW)で ViT-B16-224 をファインチューニングし、最新手法と比較して性能を評価する。
- SEがViTの注意機構と頑健性に與える影響を、注意の可視化やクロスデータベース評価を含め分析する。
- 提案モデルの転移性を gauge cross-database generalization (例: CK+ クロスデータベース評価) を評価する。
提案手法
- FERタスクのためにJFT-300Mで事前学習済みのViT-B16-224を ImageNet-1K上でファインチューニングして使用する。
- ViTの分類トークンの上にSqueeze and Excitation (SE)ブロックを組み込み、二つの全結合層とシグモイドゲート(Excitation)を用いてチャネル方向の応答を再調整し、clsトークンとの要素ごとの乗算を適用する。
- データ拡張(ランダム水平反転、ランダムグレースケール、輝度/コントラスト/彩度の変化)、CutoutとMixup正則化、AdamW最適化(lr = 1.6e-4, バッチサイズ 16)で訓練する。
- 4つのデータベース(CK+、JAFFE、RAF-DB、SFEW)を評価し、ViT、ViT+SE、FER-2013 pretraining有無を比較するアブレーション研究を実施する。
- t-SNEと注意マップ(Grad-CAM、Score-CAM、Eigen-CAM)を用いて学習表現を可視化し、局所対全体の注意とSEの影響を分析する。
実験結果
リサーチクエスチョン
- RQ1ViT with an SE block overcome FER data scarcity and deliver strong performance on both lab-controlled and wild FER datasets?
- RQ2What is the effect of the SE block on ViT’s attention and the learned representations for FER?
- RQ3Does pretraining on FER-2013 synergize with SE to improve FER performance, especially on smaller or more variable datasets?
- RQ4How well does the proposed model generalize across different FER databases (cross-database evaluation)?
主な発見
- ViT+SE は CK+ で 99.80% の精度を達成し、10-fold cross-validationで従来法を上回る。
- JAFFE では ViT+SE が 92.92% の精度を達成(10-fold cross-validation)。
- RAF-DB では ViT+SE が 87.22% の精度を達成し、最先端の単一モデル結果と競合。
- SFEW では ViT+SE が 54.29% の精度を達成(単一モデル)、他所でより高いアンサンブルベースの結果が報告されている。
- FER-2013 pretraining plus SE は野外データセット(RAF-DB, SFEW)で顕著な向上をもたらし、t-SNEと注意マップで観察されるように堅牢性と分離性を一般に高める。
- クロスデータベース CK+ 評価は ViT+SE が ResNet50 よりも一般化能力が高いことを示し、SE は CK+ から他データセットへの最良のクロスデータベース転移を提供するが、全体的な一般化は依然として穏やかである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。