Skip to main content
QUICK REVIEW

[論文レビュー] MFEViT: A Robust Lightweight Transformer-based Network for Multimodal 2D+3D Facial Expression Recognition

Hanting Li, Mingzhe Sui|arXiv (Cornell University)|Sep 20, 2021
Face and Expression Recognition参考文献 31被引用数 4
ひとこと要約

本稿では、2次元+3次元顔の感情認識を対象とした軽量で純粋なトランスフォーマー型モデル、MFEViTを提案する。このモデルは、トランスフォーマー・エンコーダーの前にRGBと深度特徴を統合する代替的統合戦略を採用し、ノイズの多いサンプルをサブクラスに再割り当てするためのサンプルフィルタリングモジュールを備えている。BU-3DFEでは90.83%、Bosphorusでは90.28%の最先端性能を達成し、パrameter数は約2300万個にとどまる。これは、複数のブランチCNNと比較して優れている。

ABSTRACT

Vision transformer (ViT) has been widely applied in many areas due to its self-attention mechanism that help obtain the global receptive field since the first layer. It even achieves surprising performance exceeding CNN in some vision tasks. However, there exists an issue when leveraging vision transformer into 2D+3D facial expression recognition (FER), i.e., ViT training needs mass data. Nonetheless, the number of samples in public 2D+3D FER datasets is far from sufficient for evaluation. How to utilize the ViT pre-trained on RGB images to handle 2D+3D data becomes a challenge. To solve this problem, we propose a robust lightweight pure transformer-based network for multimodal 2D+3D FER, namely MFEViT. For narrowing the gap between RGB and multimodal data, we devise an alternative fusion strategy, which replaces each of the three channels of an RGB image with the depth-map channel and fuses them before feeding them into the transformer encoder. Moreover, the designed sample filtering module adds several subclasses for each expression and move the noisy samples to their corresponding subclasses, thus eliminating their disturbance on the network during the training stage. Extensive experiments demonstrate that our MFEViT outperforms state-of-the-art approaches with an accuracy of 90.83% on BU-3DFE and 90.28% on Bosphorus. Specifically, the proposed MFEViT is a lightweight model, requiring much fewer parameters than multi-branch CNNs. To the best of our knowledge, this is the first work to introduce vision transformer into multimodal 2D+3D FER. The source code of our MFEViT will be publicly available online.

研究の動機と目的

  • 大規模なRGBデータで事前学習されたビジョントランスフォーマーを、低リソースな2次元+3次元顔の感情認識(FER)に効果的に適応させるため、限られた2次元+3次元FERデータセットの課題に対処すること。
  • 既存のマルチブランチCNNと比較して、モデルの複雑さとパラメータ数を低減すること。
  • トレーニング中にノイズの多いサンプルや顔の感情データにおける大きなクラス内変動が与える悪影響を軽減すること。
  • 初めて純粋なトランスフォーマー型アーキテクチャをマルチモーダル2次元+3次元FERに導入し、自己注意機構を用いてグローバル特徴を学習すること。

提案手法

  • RGBの3つのチャネルそれぞれを深度マップのチャネルに置き換える代替的統合(AF)戦略を提案し、ビジョントランスフォーマー・エンコーダーに供給する前にRGBとマルチモーダルデータの間のドメインギャップを狭める。
  • 各感情に対してサブクラスを生成し、トレーニング中にノイズの多いサンプルをこれらのサブクラスに再割り当てするサンプルフィルタリング(SF)モジュールを設計する。これにより、主クラスへの干渉を軽減する。
  • データレベルの統合後に統合されたマルチモーダル特徴にビジョントランスフォーマー(ViT)エンコーダーを適用し、最初の層からグローバル受容 field 学習を可能にする。
  • 3次元スキャンをアライメントされたRGBと深度マップペアに投影し、その後表面処理を施してデータ品質を向上させることで、2次元+3次元特徴を抽出する。
  • マルチブランチCNNを不要にする単一ブランチのトランスフォーマー型アーキテクチャを採用し、モデルパラメータ数を顕著に削減する。
  • 推論時、すべてのサブクラスを元のメインクラスに再統合し、最終的な分類と精度評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1大規模なRGBデータで事前学習されたビジョントランスフォーマーは、リソースが限られた2次元+3次元顔の感情認識に効果的に適応可能か?
  • RQ2RGBデータとマルチモーダル(2次元+3次元)データの間のドメインギャップを最小限に抑えるにはどうすればよいか?
  • RQ3単一ブランチのトランスフォーマー型モデルは、顕著に少ないパラメータ数でマルチブランチCNNを凌駆できるか?
  • RQ4ノイズの多いサンプルをサブクラスにフィルタリングすることで、顔の感情認識におけるモデルの汎化性能と精度がどの程度向上するか?

主な発見

  • MFEViTはBU-3DFEデータセットで90.83%、Bosphorusデータセットで90.28%の最先端精度を達成し、既存の最先端手法を上回っている。
  • モデルのパラメータ数を約2300万にまで低減し、VGG-M-DF(3億2700万)やDA-CNN(4億6300万)といったマルチブランチCNNと比較して顕著に少ない。
  • サンプルフィルタリングモジュールを導入することで、サブクラスフィルタリングなしのベースラインと比較して、BU-3DFEで1.39%、Bosphorusで1.11%の精度向上が達成された。
  • 代替的統合戦略により、RGBとマルチモーダルデータ間の分布ギャップが顕著に狭められ、ImageNetで事前学習されたViTからの転移学習がより効果的になった。
  • 可視化により、サブクラスへの再割り当て後、通常のサンプルとノイズの多いサンプルとの距離が顕著に短縮されていることが確認され、フィルタリングモジュールの有効性が裏付けられた。
  • 混同行列の結果、笑顔や驚きの感情では高い精度が得られた一方で、恐怖や悲しみは微細な筋肉の動きのため、依然として困難な課題であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。