[論文レビュー] Facial Expression Recognition with Swin Transformer
この論文では、イン・ザ・ワイルドなAff-Wild2データセットにおける顔の感情認識のため、視覚的、時間的、音声的モダリティを統合した、3ストリームのスウィン変換器ベースのモデルを提案する。半分ミックスジャイタリングと呼ばれる新しいデータ拡張技術を導入し、不均衡なデータに対する一般化性能を向上させ、バリデーションセットで35.71のF1スコアを達成し、ベースラインを12ポイント以上上回った。
The task of recognizing human facial expressions plays a vital role in various human-related systems, including health care and medical fields. With the recent success of deep learning and the accessibility of a large amount of annotated data, facial expression recognition research has been mature enough to be utilized in real-world scenarios with audio-visual datasets. In this paper, we introduce Swin transformer-based facial expression approach for an in-the-wild audio-visual dataset of the Aff-Wild2 Expression dataset. Specifically, we employ a three-stream network (i.e., Visual stream, Temporal stream, and Audio stream) for the audio-visual videos to fuse the multi-modal information into facial expression recognition. Experimental results on the Aff-Wild2 dataset show the effectiveness of our proposed multi-modal approaches.
研究の動機と目的
- イン・ザ・ワイルドなAff-Wild2データセットにおける顔の感情認識性能を、マルチモーダルデータを用いて向上させること。
- 顔の感情データセットにおけるクラスの不均衡を、新しいデータ拡張戦略によって解消すること。
- スウィン変換器の表現力を利用し、視覚的、時間的、音声的ストリームを統合したマルチモーダルフレームワークを構築すること。
- 部分的な顔の入力においてもモデルのロバスト性を向上させる半分ミックスジャイタリングの有効性を検証すること。
提案手法
- 視覚的、時間的、音声的ストリームのそれぞれに別々のスウィン変換器エンコーダーを搭載した3ストリームのネットワークアーキテクチャを採用する。
- 視覚ストリームは、1枚のクロップドされた顔画像を処理し、スウィン変換器Largeバックボーンを用いる。
- 時間ストリームは、1秒ごとにサンプリングされた16フレームのクリップから、スパatiotemporal特徴を抽出するS3D畳み込み層を用いる。
- 音声ストリームは、音声信号をメルスペクトログ램に変換し、その後スウィン変換器エンコーダーで処理する。
- トレーニング中に半分ミックスジャイタリングを適用し、バッチ内の同じ顔から参照画像を用いて、顔の一部(左/右または上/下)を置き換える。この際、学習可能なマスクとラベルの混合が行われる。
- 推論時には、3ストリームの予測を平均することでスコアファージョンを実行する。
実験結果
リサーチクエスチョン
- RQ1スウィン変換器ベースのマルチモーダルモデルは、制約のないイン・ザ・ワイルドな動画データにおいて、顔の感情を効果的に認識できるか?
- RQ2半分ミックスジャイタリングによるデータ拡張戦略は、不均衡な顔の感情データセットにおける性能をどのように向上させるか?
- RQ3静的視覚入力に加えて、時間的および音声的特徴は顔の感情認識にどの程度寄与するか?
- RQ4提案された3ストリームアーキテクチャとラテントファージョンは、単一ストリームやエアリー・ファージョンのベースラインを上回る性能を示すか?
主な発見
- 提案された3ストリームモデルは、バリデーションF1スコア35.71を達成し、ベースラインモデル(23.00)を著しく上回った。
- 視覚ストリーム単体でも高いF1スコア34.74を達成しており、スウィン変換器が単一フレームの顔の感情認識において優れた性能を示していることが示された。
- 時間的および音声的ストリームの追加により、視覚+時間の組み合わせ(35.08)から全3ストリームの統合(35.71)に改善されたことから、すべてのモダリティが補完的な情報を提供していることが示された。
- 半分ミックスジャイタリングは、一般化性能の向上に寄与し、特に怒り、嫌悪、恐怖、驚きといったマイノリティクラスが、拡張処理の際の参照画像として使用されたことで、顕著な改善が見られた。
- 部分的な顔の入力に対してもモデルのロバスト性が示された。これは、半分ミックスジャイタリングが顔の顕著な領域に注目するよう促進しているためである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。