[論文レビュー] Towards Semi-Supervised Deep Facial Expression Recognition with An Adaptive Confidence Margin
本稿では、アダプティブな信頼度マージンを学習することで、すべての未ラベルデータ(高信頼度および低信頼度のサンプルを含む)を有効活用する、半教師付き深層顔の感情認識手法Ada-CMを提案する。高信頼度サンプルには疑似ラベルを適用し、低信頼度サンプルには特徴レベルの対照的学習目的関数を適用する。本手法は、ラベル数が少ない設定下でも、RAF-DB、SFEW、AffectNetで完全教師ありベースラインを上回る最先端の性能を達成する。
Only parts of unlabeled data are selected to train models for most semi-supervised learning methods, whose confidence scores are usually higher than the pre-defined threshold (i.e., the confidence margin). We argue that the recognition performance should be further improved by making full use of all unlabeled data. In this paper, we learn an Adaptive Confidence Margin (Ada-CM) to fully leverage all unlabeled data for semi-supervised deep facial expression recognition. All unlabeled samples are partitioned into two subsets by comparing their confidence scores with the adaptively learned confidence margin at each training epoch: (1) subset I including samples whose confidence scores are no lower than the margin; (2) subset II including samples whose confidence scores are lower than the margin. For samples in subset I, we constrain their predictions to match pseudo labels. Meanwhile, samples in subset II participate in the feature-level contrastive objective to learn effective facial expression features. We extensively evaluate Ada-CM on four challenging datasets, showing that our method achieves state-of-the-art performance, especially surpassing fully-supervised baselines in a semi-supervised manner. Ablation study further proves the effectiveness of our method. The source code is available at https://github.com/hangyu94/Ada-CM.
研究の動機と目的
- 固定閾値の疑似ラベル付けによる半教師付き顔の感情認識の非効率性を是正すること。特に、低信頼度の未ラベルサンプルが無視されがちな点を改善する。
- 顔の感情認識の一般化性能を向上させるために、通常は破棄される低信頼度スコアを持つすべての未ラベルデータを完全に活用すること。
- 異なる感情認識カテゴリの学習難易度の変動を反映できるように、訓練中に進化するアダプティブな信頼度マージンを構築すること。
- 低信頼度サンプルに対照的目的関数を導入することで、クラス内変動に対する特徴学習を強化すること。
- ラベルデータが少ない状況下でも、完全教師ありベースラインを上回る性能を達成するため、半教師付き学習におけるデータ利用効率を向上させること。
提案手法
- 訓練中に、異なる顔の感情カテゴリにおけるモデルの予測信頼度に基づき、動的に信頼度マージンを学習する。
- すべての未ラベルサンプルを2つのサブセットに分割する:信頼度スコアがアダプティブマージン以上(サブセットI)のものと、それ未満(サブセットII)のもの。
- サブセットIに対しては、強化された入力ビューから生成された疑似ラベルとモデル予測との間で交差エントロピー損失を適用する。
- サブセットIIに対しては、InfoNCE損失を用いた特徴レベルの対照的目的関数を適用し、特徴の判別性とクラス内密着性を向上させる。
- 訓練エポックを経て、異なる感情カテゴリの学習難易度を反映できるように、信頼度マージンを繰り返し更新する。
- 本手法はエンドツーエンドで学習可能であり、疑似ラベル付けと対照的学習を統合したフレームワークに統合されている。
実験結果
リサーチクエスチョン
- RQ1固定閾値手法と比較して、アダプティブな信頼度マージンは、半教師付き顔の感情認識における未ラベルデータの活用を改善できるか?
- RQ2低信頼度未ラベルサンプルに対照的目的関数を組み込むことで、特徴学習とモデル性能にどのような影響を与えるか?
- RQ3ラベルデータの割合が非常に少ない状況下でも、Ada-CMは完全教師ありベースラインを上回ることができるか?
- RQ4アダプティブマージン機構は、認識難易度の異なるさまざまな感情カテゴリにおいて、より良い一般化性能をもたらすか?
- RQ5特にラベルデータが少ない状況下で、クロスデータセット評価において本手法はどの程度の性能を示すか?
主な発見
- 低ラベル設定下(RAF-DB:1/3、SFEW:1/2、AffectNet:1/28のラベルデータ比)で、Ada-CMは完全教師ありベースラインをそれぞれ0.29%、1.38%、4.45%上回る。
- 4,000個のラベルデータを用いて、WideResNet-28-2を用いたRAF-DBでは79.34%の正確度を達成し、MarginMixを13.28ポイント上回る。
- CK+ベンチマーク(クロスデータセット評価)において、ResNet-18を用い、4,000個のラベルデータで85.32%の正確度を達成し、完全教師ありベースラインを3.6%上回る。
- アブレーションスタディの結果、アダプティブマージンと低信頼度サンプルへの対照的目的関数の両方が、性能向上に不可欠であることが確認された。
- t-SNE可視化では、Ada-CMがより判別性の高い特徴を学習しており、特に困難なクラス(例:悲しみ)において、明確なクラス間境界とより緊密なクラス内クラスタリングが得られている。
- 本手法はデータセット間で良好な一般化性能を示し、先行研究で使用された重いモデルと比較して、軽量なResNet-18バックボーンでも優れた性能を発揮している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。