Skip to main content
QUICK REVIEW

[論文レビュー] DFEW: A Large-Scale Database for Recognizing Dynamic Facial Expressions in the Wild

Xingxun Jiang, Yuan Zong|arXiv (Cornell University)|Aug 13, 2020
Emotion and Mood Recognition参考文献 42被引用数 9
ひとこと要約

本稿では、1,500部の映画から抽出された16,372本の動画クリップを含み、ポーズの変化や部分的遮蔽といった多様な現実世界の課題を有する、大規模な屋外動的顔の感情表現データベース DFEW を紹介する。また、表情に配慮した時空間特徴を学習することで動的FERの性能を向上させる、Expression-Clustered Spatiotemporal Feature Learning (EC-STFL) フレームワークを提案し、DFEWおよび転移学習ベンチマークで最先端の結果を達成した。

ABSTRACT

Recently, facial expression recognition (FER) in the wild has gained a lot of researchers' attention because it is a valuable topic to enable the FER techniques to move from the laboratory to the real applications. In this paper, we focus on this challenging but interesting topic and make contributions from three aspects. First, we present a new large-scale 'in-the-wild' dynamic facial expression database, DFEW (Dynamic Facial Expression in the Wild), consisting of over 16,000 video clips from thousands of movies. These video clips contain various challenging interferences in practical scenarios such as extreme illumination, occlusions, and capricious pose changes. Second, we propose a novel method called Expression-Clustered Spatiotemporal Feature Learning (EC-STFL) framework to deal with dynamic FER in the wild. Third, we conduct extensive benchmark experiments on DFEW using a lot of spatiotemporal deep feature learning methods as well as our proposed EC-STFL. Experimental results show that DFEW is a well-designed and challenging database, and the proposed EC-STFL can promisingly improve the performance of existing spatiotemporal deep neural networks in coping with the problem of dynamic FER in the wild. Our DFEW database is publicly available and can be freely downloaded from https://dfew-dataset.github.io/.

研究の動機と目的

  • 制約のない環境向けに大規模で現実的である動的顔の感情表現データベースが不足しているという問題に対処すること。
  • 照明の変化、遮蔽、ポーズの変化といった現実世界の課題に対応できる、頑健なディープラーニングフレームワークの開発。
  • 実世界の応用において性能向上と転移学習を可能にするベンチマークデータセットおよびフレームワークの確立。

提案手法

  • 1,500部を超える映画から16,372本の動画クリップを抽出することで、DFEW データベースを構築した。自然で制約のない顔の表情を捉えている。
  • 各動画クリップは、10名の独立した熟練アノテーターがラベル付けを行い、7つの基本的顔の表情の信頼性の高い分布を確保した。
  • EC-STFL フレームワークは、表情カテゴリに基づいて特徴をクラスタリングする新しい損失関数を導入し、時空間特徴学習における判別力を向上させた。
  • フレームワークは、表情に配慮したクラスタリング損失と標準的な分類損失のバランスを取るためのトレードオフパラメータ λ を統合した。
  • さまざまなバッチサイズに対応するバッチ正規化戦略を採用し、学習の安定性を確保した。
  • AFEW7.0での一般化性能を評価するために、DFEW や他のアクションデータセットからの事前学習モデルを用いた転移学習実験を実施した。

実験結果

リサーチクエスチョン

  • RQ1標準的な時空間ネットワークと比較して、提案された EC-STFL フレームワークは制約のない現実世界の設定下で、動的顔の感情認識の性能をどの程度向上させるか?
  • RQ2DFEW データベースは、実生活の応用における感情認識のための転移学習性能をどの程度向上させるか?
  • RQ3EC-STFL フレームワークは、トレードオフパラメータ λ やバッチサイズといったハイパーパrameterに対してどの程度感度を示すか?
  • RQ4DFEW データベースは、既存のアクション認識データセットよりも優れた下流の感情認識タスクの事前学習ソースとして機能できるか?
  • RQ5複数のアノテーターによるラベル付けは、動的 FER 研究における DFEW データセットの信頼性と有用性にどのような影響を与えるか?

主な発見

  • EC-STFL フレームワークは、DFEW fd2 から微調整した場合、AFEW7.0 ベンチマークで53.26のWARスコアを達成し、以前の最先端手法を約2ポイント上回った。
  • DFEW からの転移学習は、UCF101 や Sports 1M、Kinect700 といった他の大規模アクションデータセットからの転移学習を上回り、DFEW が効果的な事前学習ソースであることを示した。
  • EC-STFL フレームワークは、C3D や 3D ResNet18 といった異なるバックボーンネットワーク、さまざまなバッチサイズおよびトレードオフパラメータの下でも一貫した性能向上を示した。
  • DFEW データベースは、1サンプルあたり10名の独立したアノテーターによるラベル付けのおかげで高いアノテーション信頼性を達成し、堅牢で均等に分布した表情ラベルセットを提供した。
  • 感度分析により、EC-STFL が広い範囲のバッチサイズおよび最適なトレードオフパラメータに対して安定しており、優れた一般化性能と頑健性を示していることが確認された。
  • 1,500部の多様な映画から抽出された16,372本のクリップを有する DFEW データベースは、FER 研究における豊富な現実世界の変動を提供する、公開済みの最大の屋外動的顔の感情表現データベースである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。