Skip to main content
QUICK REVIEW

[論文レビュー] E2-Capsule Neural Networks for Facial Expression Recognition Using AU-Aware Attention

Shan Cao, Yuqian Yao|arXiv (Cornell University)|Dec 5, 2019
Emotion and Mood Recognition参考文献 10被引用数 8
ひとこと要約

本稿では、顔の表情認識(FER)のための、行動単位(AU)に配慮した注目メカニズムを備えたエンドツーエンドのキャプセルネットワーク、E2-Capsnetを提案する。特徴抽出を向上させるために二重モジュール設計を採用している:(1)顔の行動単位領域に注目する初期畳み込み層におけるAUに配慮した注目、および(2)空間的関係をモデル化するための動的ルーティングを施した深層キャプセル層。RAF-DBおよびEmotioNetにおいて、E2-Capsnetはそれぞれ85.24%および55.91%の精度を達成し、最先端手法を上回った。

ABSTRACT

Capsule neural network is a new and popular technique in deep learning. However, the traditional capsule neural network does not extract features sufficiently before the dynamic routing between the capsules. In this paper, the one Double Enhanced Capsule Neural Network (E2-Capsnet) that uses AU-aware attention for facial expression recognition (FER) is proposed. The E2-Capsnet takes advantage of dynamic routing between the capsules, and has two enhancement modules which are beneficial for FER. The first enhancement module is the convolutional neural network with AU-aware attention, which can help focus on the active areas of the expression. The second enhancement module is the capsule neural network with multiple convolutional layers, which enhances the ability of the feature representation. Finally, squashing function is used to classify the facial expression. We demonstrate the effectiveness of E2-Capsnet on the two public benchmark datasets, RAF-DB and EmotioNet. The experimental results show that our E2-Capsnet is superior to the state-of-the-art methods. Our implementation will be publicly available online.

研究の動機と目的

  • 行動単位(AU)領域に注目する注目メカニズムを統合することで、顔の表情認識(FER)の性能を向上させること。
  • 動的ルーティングを用いて畳み込みネットワークとキャプセルネットワークを組み合わせることで、FERにおける特徴表現を強化すること。
  • 従来のCNNと比較して、顔の部品間の空間的関係をより効果的にモデル化すること。
  • ベンチマーク用FERデータセット、RAF-DBおよびEmotioNetにおいて、最先端の性能を達成すること。

提案手法

  • ネットワークは、特徴符号化のためのキャプセル層に置き換えた最終全結合層を除いて、VGG16をバックボーンとして使用する。
  • 顔のキーポイントランドマークを用いて、行動単位(AU)の活性領域を特定するAUに配慮した注目マップを生成し、AU中心からのマンハッタン距離に基づいた重みを付ける。
  • 注目マップは、第2段階のプーリング後の特徴マップに対して要素ごとの乗算を施し、その後第3段階の畳み込み出力に加算する。
  • プライマリーキャプセル(PrimaryCaps)とフェイスキャプセル(FaceCaps)の間で動的ルーティングを適用し、局所的特徴間の階層的関係を学習する。
  • スワーピング関数を用いてキャプセル出力を正規化し、表情クラスの確率を表現する。
  • マージン損失と再構成損失を最小化することで、GPU上でエンドツーエンドに訓練する。

実験結果

リサーチクエスチョン

  • RQ1AUに配慮した注目は、顔の活性領域に注目することで、顔の表情認識における特徴抽出を向上させることができるか?
  • RQ2複数の畳み込み層とキャプセルネットワークを組み合わせることで、FERにおける特徴表現が向上するか?
  • RQ3キャプセル間の動的ルーティングは、従来のCNNと比較して、顔の表情における空間的関係をより効果的にモデル化できるか?
  • RQ4注目とキャプセルネットワークの統合により、ベンチマークFERデータセットにおいて優れた性能が得られるか?

主な発見

  • RAF-DBデータセットにおいて、E2-Capsnetは85.24%の精度を達成し、2番目に優れた手法(RCCnet)を0.46%上回った。
  • EmotioNetでは、E2-Capsnetが55.91%の精度を達成し、比較したすべての最先端手法を上回った。
  • アブレーションスタディの結果、注目と動的ルーティングの両方を追加することで、単に注目のみを用いるAVGGnetと比較して性能が5.95%向上した。
  • 動的ルーティングと豊富な畳み込み層(RCCnet)を備えたモデルは84.78%の精度を達成し、階層的特徴抽出の利点を示した。
  • T-SNEを用いた可視化により、E2-CapsnetはCapsnet、VGG16、FERAttと比較して、より識別性の高い特徴表現を生成することが確認された。
  • 注目メカニズムは、眉や口角などのAU活性領域を効果的に強調しており、顔の行動単位パターンと整合していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。