Skip to main content
QUICK REVIEW

[論文レビュー] Learn From All: Erasing Attention Consistency for Noisy Label Facial Expression Recognition

Yuhang Zhang, Chengrui Wang|arXiv (Cornell University)|Jul 21, 2022
Machine Learning and Data Classification被引用数 8
ひとこと要約

本稿では、顔の感情認識におけるノイズありラベルの記憶を抑えるために、トレーニング中に画像の反転に対する注目マップの一貫性を強制することで、モデルがラベルに相関する特徴に集中するのを防ぐ、Erasing Attention Consistency (EAC) という新しい手法を提案する。EAC は、ノイズ率の推定やラベルアンサンブルを必要とせず、ノイズありおよびクリーンな FER ベンチマークで最先端の性能を達成する。

ABSTRACT

Noisy label Facial Expression Recognition (FER) is more challenging than traditional noisy label classification tasks due to the inter-class similarity and the annotation ambiguity. Recent works mainly tackle this problem by filtering out large-loss samples. In this paper, we explore dealing with noisy labels from a new feature-learning perspective. We find that FER models remember noisy samples by focusing on a part of the features that can be considered related to the noisy labels instead of learning from the whole features that lead to the latent truth. Inspired by that, we propose a novel Erasing Attention Consistency (EAC) method to suppress the noisy samples during the training process automatically. Specifically, we first utilize the flip semantic consistency of facial images to design an imbalanced framework. We then randomly erase input images and use flip attention consistency to prevent the model from focusing on a part of the features. EAC significantly outperforms state-of-the-art noisy label FER methods and generalizes well to other tasks with a large number of classes like CIFAR100 and Tiny-ImageNet. The code is available at https://github.com/zyh-uaiaaaa/Erasing-Attention-Consistency.

研究の動機と目的

  • クラス間の類似性やアノテーションの曖昧さがモデルの一般化を複雑にする、顔の感情認識 (FER) におけるノイズありラベル学習の課題に対処すること。
  • 損失に基づくサンプルフィルタリングや複雑なラベルアンサンブルに依存する既存手法の限界を克服すること。これらの手法は、難易度の高いサンプルをノイズのあるものと混同するおそれがあり、計算コストが高くなることがある。
  • ノイズありラベルの記憶を抑えるために、ラベルに相関する特徴に注目するのを妨げる、新たな特徴学習の視点を提案すること。
  • アーキテクチャやハイパーパrameterの再調整なしに、CIFAR100 や Tiny-ImageNet などの多数クラス分類タスクに一般化できる方法を開発すること。
  • ノイズ率の事前知識や複数モデルのトレーニングを必要とせず、実世界の応用における実用性を高めること。

提案手法

  • モデルが全体的な特徴を学習するよう促すために、トレーニング中に入力画像からランダムにパッチを消去する不均衡なトレーニングフレームワークを設計する。
  • 画像とその水平反転版に対する注目マップが類似していることを要件として、反転注目一貫性を強制する。
  • 元の画像と反転画像の注目マップの差異をペナルティ化する一貫性損失を導入し、頑健で一般化可能な特徴表現を促進する。
  • 反転注目一貫性損失を正則化項として用い、誤ったラベルに関連する部分的な特徴に注目するのを防ぐことで、ノイズありラベルの記憶を抑える。
  • 交差エントロピー損失と提案された一貫性損失の組み合わせで、エンドツーエンドにモデルをトレーニングし、一貫性損失の重み $λ$ は経験的に調整する。
  • 顔の感情表現がもつ対称性(反転により意味的コンテンツは保存されるがラベルは変化する)を活用し、モデルが潜在的な真の特徴を学習するように間接的に誘導する。

実験結果

リサーチクエスチョン

  • RQ1画像の反転における注目一貫性を強制することで、顔の感情認識におけるノイズありラベルの記憶が軽減されるか?
  • RQ2損失に基づくサンプルフィルタリングを避ける特徴学習アプローチは、従来の手法を上回る性能を示すか?
  • RQ3低クラス分類タスク向けに設計された手法が、CIFAR100 や Tiny-ImageNet などの高クラス分類タスクにも効果的に一般化できるか?
  • RQ4EAC は、クリーンおよびノイズありデータセットにおいて、さまざまなノイズ率の下で最先端の手法と比較してどのように性能を発揮するか?
  • RQ5EAC は、ノイズあり学習のシナリオにおいて、ノイズ率の推定やラベルアンサンブルへの依存をどの程度軽減できるか?

主な発見

  • ノイズありラベル下で RAF-DB において 89.99% の正確度を達成し、以前の最先端手法 (RUL 88.98%) を上回り、すべてのベースラインを上回る。
  • AffectNet (7クラス) では、同じ評価プロトコル下で 65.32% のトップ-1正確度を達成し、以前の最先端手法 (KTN 63.97%) を上回る。
  • FERPlus では 89.64% の正確度を達成し、RUL (88.75%) や DMUE (88.64%) を上回り、ラベルアンサンブルを回避している。
  • 30% のノイズを含む CIFAR100 では、ベースライン比でトップ-1正確度が 10.89 パーセンテージポイント向上し、30% のノイズを含む Tiny-ImageNet では 22.19 パーセンテージポイント向上した。
  • EAC は、ノイズ率の推定やマルチブランチアーキテクチャを必要とせず、データセットやノイズレベルにかかわらず一貫した性能向上を示し、一般化性能に優れる。
  • アブレーションスタディにより、一貫性損失は $λ$ の広い範囲で有効であることが確認され、RAF-DB で 30% のノイズ下では $λ = 5$ のときに最適な性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。