Skip to main content
QUICK REVIEW

[論文レビュー] Multi-label Transformer for Action Unit Detection

Gauthier Tallec, Edouard Yvinec|arXiv (Cornell University)|Mar 23, 2022
Emotion and Mood Recognition被引用数 6
ひとこと要約

本論文は、顔のパッチにおける自己注意と、学習されたAUトークンと画像特徴の間のクロス注意を活用して、各AUごとに関連する顔領域を局所化する、マルチラベルTransformerアーキテクチャを提案する。この手法は、ABAW3チャレンジでテスト平均F1スコア53.8を達成し、注目に基づく特徴選択と周波数重み付けおよびDice損失によるクラス不均衡の処理によって、性能の向上を示した。

ABSTRACT

Action Unit (AU) Detection is the branch of affective computing that aims at recognizing unitary facial muscular movements. It is key to unlock unbiased computational face representations and has therefore aroused great interest in the past few years. One of the main obstacles toward building efficient deep learning based AU detection system is the lack of wide facial image databases annotated by AU experts. In that extent the ABAW challenge paves the way toward better AU detection as it involves a 2M frames AU annotated dataset. In this paper, we present our submission to the ABAW3 challenge. In a nutshell, we applied a multi-label detection transformer that leverage multi-head attention to learn which part of the face image is the most relevant to predict each AU.

研究の動機と目的

  • 顔の画像におけるマルチラベルAU検出の課題に取り組む。これは、局所的な筋肉の動きと高いAU間依存性を含む。
  • 注目メカニズムを用いて、各AUを予測する際に最も関連する顔領域を学習することで、AU検出を改善する。
  • ほとんどのフレームでAU活性化がないというクラス不均衡を緩和するため、周波数ベースの損失重み付けとDice損失を用いる。
  • マスクされたAUアノテーションとデータ拡張を用いた関連データセット(DISFA、BP4D)での事前学習により、性能を向上させる。
  • 提案アーキテクチャの有効性を、大規模かつ現実世界のAU検出ベンチマークであるABAW3チャレンジで検証する。

提案手法

  • モデルは、画像パッチ埋め込みと位置エンコーディングを用いて顔画像を処理する、ビジョンTransformerベースのアーキテクチャを採用する。
  • 自己注意を画像パッチ上に適用し、顔全体にわたる局所的で文脈に配慮した特徴を学習する。
  • 学習されたAUトークンがクロス注意を通じて画像特徴に注目することで、各AUに対して関連する顔領域を動的に選択できる。
  • アーキテクチャは、トランスフォーマーブロックのスタックに、マルチヘッドアテンション、レイヤーナーマライゼーション、およびフィードフォワードネットワークを統合する。
  • 最終的なプロジェクションヘッドはシグモイド活性化関数を用い、各AUの確率を出力し、予測は20フレームのウィンドウにわたって平滑化してセグメントレベルのAUイベントをモデル化する。
  • 学習には、周波数ベースのクラス重みを付加したバイナリクロスエントロピーとDice損失を組み合わせたハイブリッド損失を用いる。これにより、長尾クラス分布への対処が可能となる。

実験結果

リサーチクエスチョン

  • RQ1AUトークンと画像特徴の間のクロス注意を有するマルチラベルTransformerは、個々のAUの関連する顔領域の局所化を改善できるか?
  • RQ2注目に基づく特徴選択は、AU活性化の非常に局所的かつ一時的な性質を捉えるのにどの程度効果的か?
  • RQ3マスクされたアノテーションを用いた関連AUデータセット(DISFA、BP4D)での事前学習は、ABAW3ベンチマークでの性能向上にどの程度寄与するか?
  • RQ4周波数ベースの損失重み付けとDice損失を組み合わせることで、不均衡なAU検出におけるF1スコアは顕著に向上するか?
  • RQ5時間的平均化を用いることで、フレームレベルの予測を効果的にセグメントレベルのAU検出に変換できるか?

主な発見

  • モデルはABAW3チャレンジでテスト平均F1スコア53.8を達成し、報告された設定の中で最高性能の提出となった。
  • 20フレームの移動平均を用いた予測の平滑化は、時間的整合性と性能の向上に顕著な効果を示した。
  • マスクされたAUアノテーションを用いたDISFAおよびBP4Dデータセットでの事前学習は、性能の向上に寄与したが、表では明確な増加量は示されていない。
  • 周波数ベースの損失重み付けとDice損失の組み合わせは、長尾AU分布の処理を改善し、F1スコアの向上に寄与した。
  • ミックスアップおよび幾何的/色彩変換を含むデータ拡張技術は、一般化性能と耐性を向上させた。
  • アブレーションスタディの結果、移動平均を削除するか周波数重み付けを削除すると性能が低下(それぞれ52.7%および50.3%に低下)し、これらが重要であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。