Skip to main content
QUICK REVIEW

[論文レビュー] Emotion Recognition for In-the-wild Videos

Hanyu Liu, Jiabei Zeng|arXiv (Cornell University)|Feb 13, 2020
Emotion and Mood Recognition参考文献 19被引用数 7
ひとこと要約

本論文では、101層のResNetと畳み込みブロック注意モジュール(CBAM)、および双方向LSTM(BLSTM)を組み合わせたハイブリッドディープラーニングモデルを提案し、非制約的(in-the-wild)な動画におけるエンドツーエンドの顔の感情認識を実現する。この手法は、Aff-Wild2の検証セットで64.3%の正確性と43.4%の最終指標(S)を達成し、ベースラインより7.43ポイント高い性能を示した。

ABSTRACT

This paper is a brief introduction to our submission to the seven basic expression classification track of Affective Behavior Analysis in-the-wild Competition held in conjunction with the IEEE International Conference on Automatic Face and Gesture Recognition (FG) 2020. Our method combines Deep Residual Network (ResNet) and Bidirectional Long Short-Term Memory Network (BLSTM), achieving 64.3% accuracy and 43.4% final metric on the validation set.

研究の動機と目的

  • 非制約的で現実世界の動画データ(in-the-wild動画)における7つの基本的顔の感情を認識する課題に対処すること。
  • 顔の動きの空間的特徴抽出と時間的モデリングを活用することで、顔の感情認識の性能を向上させること。
  • 特にCBAMを用いた注意メカニズムにより、関連する顔領域やチャネルに注目することで、深層ネットワーク内の特徴表現を強化すること。
  • 現実世界の動画データに見られる多様な照明、ポーズ、感情の変動に対しても耐性を持つモデルを構築すること。

提案手法

  • 各残差ブロックの後にCBAMモジュールを挿入した101層のResNetを用い、空間的およびチャネルワイドの特徴注目を強化する。
  • CBAMを用いて、空間的位置と特徴チャネルの両方の注意重みを学習し、特徴マップを精緻化することで識別能を向上させる。
  • 連続する動画フレーム間の長距離時間的依存関係をモデル化するため、抽出されたフレームレベル特徴を双方向LSTM(BLSTM)で処理する。
  • 8フレームの連続した動画クリップを処理し、必要に応じてゼロパディングを適用してシーケンスの一貫性を維持する。
  • ニュートラル、怒り、嫌悪、恐怖、喜び、悲しみ、驚きの7つの感情クラスを予測するため、全結合層を用いた分類ヘッドを採用する。
  • 複数のデータセットを用いた事前学習設定において、確率的勾配降下法(SGD)を用いて学習を行い、交差エントロピー損失関数、初期学習率0.0001、モーメンタム0.9を設定する。

実験結果

リサーチクエスチョン

  • RQ1注意メカニズムを組み込んだハイブリッドCNN-RNNアーキテクチャは、非制約的動画環境下での顔の感情認識の正確性を向上させることができるか?
  • RQ2ResNetにCBAMを統合することで、顔の感情認識における特徴表現がどの程度向上するか?
  • RQ3単方向または非再帰的アプローチと比較して、時間的シーケンスを双方向LSTMでモデリングすることで、認識性能がどの程度向上するか?
  • RQ4提案手法は、Aff-Wild2データセットにおいて、ベースラインモデルと比較して正確性およびF1スコアの両面で優れているか?

主な発見

  • 提案されたResNet+CBAM+BLSTMモデルは、Aff-Wild2データセットの検証セットで64.3%の正確性を達成した。
  • モデルは最終指標(S)として43.4%を達成し、コンペティションのアナウンスで報告された36%のベースラインより7.43ポイント高い結果となった。
  • ResNet-101のバックボーンにCBAMを追加することで、F1スコアは0.281(ResNet+BLSTM)から0.333に向上し、クラスごとのバランスが改善された。
  • 多様な感情カテゴリにわたる性能向上が確認されたことから、モデルはin-the-wild動画データの変動に対して高い耐性を示した。
  • 最良のモデルは検証セットの性能に基づいてチェックポイントから選択されたため、ハイパーパrameterおよびトレーニングスケジュールの最適化が効果的に行われたことが示された。
  • AffectNet、RAF-DB、および自ら収集した30万枚の画像データセットを用いた複数データセット事前学習が、一般化性能および最終的な性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。