Skip to main content
QUICK REVIEW

[論文レビュー] Facial Action Unit Detection via Adaptive Attention and Relation

Zhiwen Shao, Lixin Zou|arXiv (Cornell University)|Jan 5, 2020
Emotion and Mood Recognition参考文献 29被引用数 5
ひとこと要約

本論文は、顔の行動単位(AU)検出のための、アダプティブなアテンションと関係性(AAR)フレームワークを提案する。このフレームワークは、ランドマークガイドドの局所的アテンションと学習可能なグローバルアテンションを、アダプティブなアテンション回帰ネットワークを介して統合し、アダプティブなグラフ畳み込みネットワークを用いてAU特有の空間的・時間的依存関係をモデル化する。本手法は、地域的相関を正確に学習し、AUのダイナミクスに対処することで、制約付き(BP4D、DISFA、GFT)および非制約付き(Aff-Wild2)のベンチマークで最先端の性能を達成する。

ABSTRACT

Facial action unit (AU) detection is challenging due to the difficulty in capturing correlated information from subtle and dynamic AUs. Existing methods often resort to the localization of correlated regions of AUs, in which predefining local AU attentions by correlated facial landmarks often discards essential parts, or learning global attention maps often contains irrelevant areas. Furthermore, existing relational reasoning methods often employ common patterns for all AUs while ignoring the specific way of each AU. To tackle these limitations, we propose a novel adaptive attention and relation (AAR) framework for facial AU detection. Specifically, we propose an adaptive attention regression network to regress the global attention map of each AU under the constraint of attention predefinition and the guidance of AU detection, which is beneficial for capturing both specified dependencies by landmarks in strongly correlated regions and facial globally distributed dependencies in weakly correlated regions. Moreover, considering the diversity and dynamics of AUs, we propose an adaptive spatio-temporal graph convolutional network to simultaneously reason the independent pattern of each AU, the inter-dependencies among AUs, as well as the temporal dependencies. Extensive experiments show that our approach (i) achieves competitive performance on challenging benchmarks including BP4D, DISFA, and GFT in constrained scenarios and Aff-Wild2 in unconstrained scenarios, and (ii) can precisely learn the regional correlation distribution of each AU.

研究の動機と目的

  • 固定された局所的アテンションマップとノイズの多いグローバルアテンションの限界を解消すること。
  • 共有される関係的パターンを超えて、動的でAU特有の空間的および時間的依存関係をモデル化すること。
  • 現実世界の顔の表情におけるずれや部分的遮蔽に対して高い耐性を発揮すること。
  • きめ細やかな事前知識に依存せずに、各AUの正確な領域相関分布を学習すること。
  • 統一的でアダプティブなアテンション学習メカニズム内で、局所的およびグローバルな依存関係を統合すること。

提案手法

  • アダプティブなアテンション回帰ネットワークは、ランドマークに基づく事前定義アテンションと特徴駆動の最適化を組み合わせることで、各AUのアテンションマップを学習し、局所的およびグローバルな依存関係の両方を捉える。
  • ネットワークは回帰ヘッドを用い、AU検出の教師信号に基づいてアテンションマップを予測することで、サンプルごとに動的に適応可能となる。
  • アダプティブな空間的・時間的グラフ畳み込みネットワークは、学習可能なAUに特化したグラフ構造を用いて、AU特有のパターン、AUs間の依存関係、時間的ダイナミクスをモデル化する。
  • グラフ構造はAUごとに動的に更新され、共通パラメータではなく、異なるAUに対して個別な推論パターンを可能にする。
  • フレームワークはAU検出とアテンション学習を同時に最適化し、アテンションの事前定義が不要な領域を抑制する正則化として機能する。
  • 本手法は制約付きおよび非制約付きデータセット上でエンドツーエンドで学習され、アブレーションスタディにより各構成要素の寄与度が検証されている。

実験結果

リサーチクエスチョン

  • RQ1ランドマークの事前知識と特徴駆動の最適化を統合したアダプティブなアテンション学習は、AU検出の精度を向上させることができるか?
  • RQ2グラフネットワークにおけるAU特有の関係的推論は、共通パラメータを持つ関係的モデルを上回る性能を発揮するか?
  • RQ3局所的およびグローバルアテンションの統合は、各AUの正確な領域相関学習を促進するか?
  • RQ4本手法は、現実世界の設定における顔のずれや遮蔽に対してどれほど耐性を示すか?
  • RQ5アダプティブなグラフネットワークは、連続する顔の表情におけるAUs間の依存関係と時間的ダイナミクスを効果的にモデル化できるか?

主な発見

  • AARフレームワークは、制約付きおよび非制約付きの両状況下で、BP4D、DISFA、GFT、Aff-Wild2ベンチマークで最先端の性能を達成した。
  • 本手法は、各AUの領域相関分布を正確に学習し、アテンションマップにおける不要な領域の抑制を効果的に行った。
  • アブレーションスタディにより、アダプティブなアテンション回帰およびアダプティブなグラフコンponentsの両方が、AU検出性能の向上に顕著に寄与することが確認された。
  • 可視化結果から、学習されたアテンションマップが、遮蔽やずれがあってもAU関連領域を正確に局所化していることが示され、先行するアダプティブ手法を上回った。
  • 事前定義または完全に学習されたアテンションに依存する手法と比較して、ランドマークのずれや部分的遮蔽に対して優れた耐性を示した。
  • アダプティブなグラフネットワークは、AU特有のパターンと時間的依存関係を効果的に捉え、共通パラメータを持つ関係的モデルを上回る性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。