[論文レビュー] Leave No Stone Unturned: Mine Extra Knowledge for Imbalanced Facial Expression Recognition
本稿では、長尾分布にさらされる顔の感情認識(FER)の性能を向上させるための新規手法を提案する。少数派クラスに関する追加の知識を、主に多数派と少数派の両方のサンプルから抽出することで、モデルの汎化性能を向上させる。再バランス処理を施した注意一致と再バランス処理を施した滑らかなラベルを導入し、データリサンプリングを一切行わず、長尾分布にさらされたFERベンチマークで最先端の性能を達成した。
Facial expression data is characterized by a significant imbalance, with most collected data showing happy or neutral expressions and fewer instances of fear or disgust. This imbalance poses challenges to facial expression recognition (FER) models, hindering their ability to fully understand various human emotional states. Existing FER methods typically report overall accuracy on highly imbalanced test sets but exhibit low performance in terms of the mean accuracy across all expression classes. In this paper, our aim is to address the imbalanced FER problem. Existing methods primarily focus on learning knowledge of minor classes solely from minor-class samples. However, we propose a novel approach to extract extra knowledge related to the minor classes from both major and minor class samples. Our motivation stems from the belief that FER resembles a distribution learning task, wherein a sample may contain information about multiple classes. For instance, a sample from the major class surprise might also contain useful features of the minor class fear. Inspired by that, we propose a novel method that leverages re-balanced attention maps to regularize the model, enabling it to extract transformation invariant information about the minor classes from all training samples. Additionally, we introduce re-balanced smooth labels to regulate the cross-entropy loss, guiding the model to pay more attention to the minor classes by utilizing the extra information regarding the label distribution of the imbalanced training data. Extensive experiments on different datasets and backbones show that the two proposed modules work together to regularize the model and achieve state-of-the-art performance under the imbalanced FER task. Code is available at https://github.com/zyh-uaiaaaa.
研究の動機と目的
- 実世界のデータセットに見られる深刻なクラス不均衡の影響により、少数派の感情クラスにおけるFERの性能低下を是正すること。
- 従来のFER手法が少数派クラスのサンプルにのみ依存するという限界を克服し、多数派クラスからも有益な特徴を活用できるようにすること。
- データリサンプリングによる性能低下を回避しつつ、多数派クラスの高い精度を維持しながら、すべてのクラスにおける平均精度を著しく向上させること。
- FERをラベル分布学習のタスクとして定式化し、多数派クラスのサンプルに少数派クラスに関する潜在的な知識が埋め込まれていることを活かすこと。
- すべてのトレーニングサンプルから変換不変特徴を抽出することで、モデルの汎化性能を向上させる、軽量でバックボーンに依存しない手法を開発すること。
提案手法
- 各入力サンプルに対して、全感情クラスにおける注目マップの一貫性を計算する再バランス処理を施した注目一致モジュールを提案。クラス固有の再バランス重みを用い、各クラスの有効なサンプル数に反比例する。
- ラベル分布にクラスバランス重みを適用することで、再バランス処理を施した滑らかなラベルを導入。これにより、交差エントロピー損失がトレーニング中に少数派クラスに重点を置く正則化が可能になる。
- 真のラベルクラスに限らず、全クラスの注目マップを用いて、モデルがロバストで変換不変の表現を学習できるように誘導。ラベル分布学習にインspiredされたアプローチ。
- ノイズの多いラベルの記憶を防ぎ、特徴の汎化性能を向上させるために、再バランス処理を施した注目一致を正則化損失として適用。
- 標準的な交差エントロピー損失と再バランス処理を施した滑らかなラベル損失を組み合わせ、モデルの意思決定境界を少数派クラスの識別に適応させる。
- ResNet や Vision Transformers などのさまざまなバックボーンと互換性を持つように設計された、アーキテクチャ変更なしのプラグアンドプレイモジュールを採用。
実験結果
リサーチクエスチョン
- RQ1多数派の顔の感情クラス(例:驚き)のサンプルは、少数派クラス(例:恐怖や嫌悪)の認識に役立つ、転送可能な特徴を含んでいるだろうか?
- RQ2データセットの分布を変更せずに、多数派と少数派の両方のサンプルから少数派クラスに関する知識を効果的に抽出・活用する方法は何か?
- RQ3再バランス処理を施した注目一致は、標準的な注目正則化を上回るモデルのロバスト性と汎化性能を向上させられるだろうか?
- RQ4ラベル分布の知識に基づいて再バランス処理を施した滑らかなラベルを組み込むことで、多数派クラスの精度を損なうことなく少数派クラスの性能が向上するだろうか?
- RQ5この手法は、不均衡要因が異なるさまざまなバックボーンやデータセットに、どの程度一般化可能だろうか?
主な発見
- 提案手法は、RAF-DB、AffectNet、FERPlus を含む複数の不均衡FERベンチマークで最先端の平均精度を達成した。
- 長尾分布を持つ RAF-DB において、ベースラインモデルと比較して平均精度を最大4.2%向上させたが、全体の精度は高い水準を維持した。
- アブレーションスタディにより、再バランス処理を施した注目一致モジュールと再バランス処理を施した滑らかなラベルモジュールが、独立してかつ相乗的に性能向上に寄与していることが確認された。
- ResNet-50 や Vision Transformers などの異なるバックボーンにおいても一貫した向上が得られ、優れた汎化性能とプラグアンドプレイ互換性を示した。
- 主に「嬉しい」「ニュートラル」などの多数派クラスの精度に顕著な低下を来さずに、少数派クラス(例:恐怖、嫌悪)の性能が向上した。これはクラス不均衡の核心的課題を効果的に解決した。
- 手法は軽量で効率的であり、データリサンプリングや複雑なアーキテクチャ変更を一切必要としないため、実世界の展開において実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。