Skip to main content
QUICK REVIEW

[論文レビュー] Affect Expression Behaviour Analysis in the Wild using Consensual Collaborative Training

Darshan Gera, S. Balasubramanian|arXiv (Cornell University)|Jul 8, 2021
Emotion and Mood Recognition参考文献 34被引用数 4
ひとこと要約

本論文では、アノテーションのノイズに強い、野外での顔の感情認識のためのロバストなディープラーニングフレームワークであるConsensual Collaborative Training (CCT) を提案する。ノイズのあるアノテーションを緩和するために、動的ブレンドの監督損失と一貫性損失を用いて3つのネットワークを共同学習させる。この手法は、Aff-Wild2データセットにおいて、複数の競合手法を上回り、3ネットワーク構成とAffectNetでの事前学習を組み合わせた場合、検証セットで全体スコア0.4814を達成した。音声やランドマーク特徴を一切使用せず、ノイズの多い実世界の条件下でも優れた一般化性能を示した。

ABSTRACT

Facial expression recognition (FER) in the wild is crucial for building reliable human-computer interactive systems. However, annotations of large scale datasets in FER has been a key challenge as these datasets suffer from noise due to various factors like crowd sourcing, subjectivity of annotators, poor quality of images, automatic labelling based on key word search etc. Such noisy annotations impede the performance of FER due to the memorization ability of deep networks. During early learning stage, deep networks fit on clean data. Then, eventually, they start overfitting on noisy labels due to their memorization ability, which limits FER performance. This report presents Consensual Collaborative Training (CCT) framework used in our submission to expression recognition track of the Affective Behaviour Analysis in-the-wild (ABAW) 2021 competition. CCT co-trains three networks jointly using a convex combination of supervision loss and consistency loss, without making any assumption about the noise distribution. A dynamic transition mechanism is used to move from supervision loss in early learning to consistency loss for consensus of predictions among networks in the later stage. Co-training reduces overall error, and consistency loss prevents overfitting to noisy samples. The performance of the model is validated on challenging Aff-Wild2 dataset for categorical expression classification. Our code is made publicly available at https://github.com/1980x/ABAW2021DMACS.

研究の動機と目的

  • 大規模な野外顔の感情認識データセット(例:Aff-Wild2)におけるノイズの多いアノテーションが、深層ネットワークの記憶化に起因するモデル性能の低下を緩和するための挑戦に応えること。
  • ノイズ分布の事前知識やアーキテクチャ制約を必要としない、ノイズに強い学習フレームワークを開発すること。
  • トレーニング中に複数のネットワーク間のコンSENSUSを活用することで、顔の感情認識の一般化性能を向上させること。
  • ABAW 2021 コンペティションにおける挑戦的なAff-Wild2データセット上で、提案手法の有効性を検証すること。

提案手法

  • 同じアーキテクチャだが異なる初期化を持つ3つの深層ニューラルネットワークを共同学習させることで、多様な学習経路を促進し、個々の誤差蓄積を低減する。
  • トレーニング損失は交差エントロピー監督損失と一貫性損失の凸結合であり、時間の経過に伴い監督からコンセンサス構築へとシフトするガウス型のラムプアップ関数によって動的バランスされる。
  • 一貫性損失は、3つのネットワークの予測の後方分布を一致させることで、ノイズの多いラベルへの過学習を防ぐ。
  • 動的重み係数λは、学習初期では監督損失を強調し、後期には一貫性損失を優先することで、最初にクリーンなデータで学習し、その後ハードサンプルでコンセンサスを形成する。
  • このフレームワークはアーキテクチャに依存せず、特定のノイズ分布を仮定しないため、ノイズのあるFERデータセットに広く適用可能である。
  • AffectNetのような大規模データセットでの事前学習は性能向上に寄与し、アブレーションスタディにより3ネットワーク構成と一貫性損失の有効性が確認された。

実験結果

リサーチクエスチョン

  • RQ13つの深層ネットワークを動的損失遷移とともに共同学習させることで、顔の感情認識におけるノイズのあるアノテーションの影響を軽減できるか?
  • RQ2監督損失と一貫性損失の動的バランスが、ノイズのある野外データセットにおけるモデル一般化性能にどのように影響するか?
  • RQ3ラベルノイズの存在下で、共同学習に最適なネットワーク数は何か?
  • RQ4AffectNetのような大規模データセットでの事前学習は、CCTフレームワークでの性能向上に寄与するか?
  • RQ5監督損失のみで学習する場合と比較して、一貫性損失を含めることの効果は何か?

主な発見

  • 3ネットワークのCCT設定が、Aff-Wild2の検証セットで最高の性能を示し、全体スコア0.4814を達成した。1、2、4ネットワークのモデルを上回った。
  • β = 4.0 の動的バランス要因が最良の性能(全体スコア0.4814)をもたらし、監督から一貫性への遷移が最適であることを示した。
  • AffectNetでの事前学習は、RAFDB や MS-Celeb-1M よりも顕著に性能向上(F1: 0.4040、Accuracy: 0.6378)をもたらし、大規模FERにおける価値を確認した。
  • オーバーサンプリングは性能向上に寄与せず、最終的な訓練から除外された。最良のモデルはオーバーサンプリングなしで訓練された。
  • 一貫性損失の導入により、全体スコアは監督損失のみの使用時(0.445)から0.454に向上し、ノイズラベルへの過学習低減の有効性が示された。
  • テストセットのF1スコアは0.4646を達成し、音声や動画特徴を一切使用せず、ABAW 2021 表現分類トラックで上位参加者に位置付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。