[論文レビュー] Revisiting Self-Supervised Contrastive Learning for Facial Expression Recognition
本稿では、顔の感情認識のための自己教師付き対照学習フレームワークを提案する。本手法は、有効なデータ拡張、ハードネガティブペアサンプリング、およびマスクベース戦略(MaskFN)による偽ネガティブペアのキャンセルを導入することで、感情固有の表現学習を向上させる。本手法は、カテゴリー的および次元的FERベンチマークの両方で最先端の性能を達成し、既存の自己教師付きアプローチを上回る。
The success of most advanced facial expression recognition works relies heavily on large-scale annotated datasets. However, it poses great challenges in acquiring clean and consistent annotations for facial expression datasets. On the other hand, self-supervised contrastive learning has gained great popularity due to its simple yet effective instance discrimination training strategy, which can potentially circumvent the annotation issue. Nevertheless, there remain inherent disadvantages of instance-level discrimination, which are even more challenging when faced with complicated facial representations. In this paper, we revisit the use of self-supervised contrastive learning and explore three core strategies to enforce expression-specific representations and to minimize the interference from other facial attributes, such as identity and face styling. Experimental results show that our proposed method outperforms the current state-of-the-art self-supervised learning methods, in terms of both categorical and dimensional facial expression recognition tasks.
研究の動機と目的
- 自己教師付き対照学習における感情固有表現の学習の課題に取り組むこと。特に、アイデンティティおよびスタイル特徴がショートカット学習信号として作用する点に焦点を当てる。
- 自己教師付き表現学習における、顔のアイデンティティ、ヘアスタイル、メイクなどの非感情属性からの干渉を最小限に抑えること。
- 大規模なアノテート済みデータセットに依存せずに、カテゴリー的表現分類および次元的価値・覚醒度回帰の両方の性能を向上させること。
- 対照学習における誤った相関関係を低減させつつ、分離された感情関連特徴を強制する戦略を開発すること。
提案手法
- 時間的拡張(TimeAug)を適用する新しいデータ拡張戦略を導入し、ポジティブペアにおける時間的整合性と感情感受性を向上させる。
- 外見が似ているが異なる感情ラベルを持つペアを優先してサンプリングするハードネガティブペアサンプリング法を採用し、識別難易度を高め、特徴の一般化を促進する。
- 顔の領域(目と口)をマスクすることで、偽陽性をネガティブと学習するのを防ぎ、偽ネガティブペアを削減する偽ネガティブキャンセル機構(MaskFN)を提案する。
- 対照的事前学習中に、表現関連領域(目と口)を分離して強調するためのマスクド特徴抽出モジュールを用いる。
- 下流タスク(FERおよび顔認識)における表現品質と分離性を評価するために、線形プローブおよびKNNベースの評価を実施する。
- 最大250エポックまで延長した訓練を実施し、顔認識における性能劣化をモニタリングすることで、アイデンティティ除去の目的の妥当性を検証する。
実験結果
リサーチクエスチョン
- RQ1有効なデータ拡張は、自己教師付き対照学習における感情固有表現学習を向上させることができるか?
- RQ2ハードネガティブペアの数を増やすことで、モデルが異なる感情表現を区別する能力が向上するか?
- RQ3標的的なマスキング戦略により、偽ネガティブペアを削減でき、下流のFER性能が向上するか?
- RQ4MaskFNによってアイデンティティ関連情報を除去することで、感情表現の一般化性能はどの程度向上するか?
主な発見
- 線形プローブを用いたFer-2013データセットでは、提案手法が59.5%のF1スコアを達成し、以前のSOTA自己教師付き手法を2.6ポイント上回った。
- 150エポックの事前学習を経たモデルは、LFW顔認識ベンチマークで65.4%のトップ1正答率を達成し、アイデンティティ関連特徴の効果的な抑制を示した。
- 1つの偽ネガティブペアを追加した際、MaskFN戦略によりFER性能が0.5%向上した。これは、偽ネガティブペアの削減に有効であることを裏付けた。
- 価値・覚醒度回帰(CCCおよびRMSE)における性能は、MaskFN導入後やや低下したが、これはカテゴリー的および次元的表現学習の間でトレードオフが生じている可能性を示唆している。
- 過学習が顔認識性能の劣化を引き起こすことが確認され、長時間の訓練によりアイデンティティ情報が学習される傾向があることが示された。これは、アイデンティティ関連特徴の抑制という目的と整合的である。
- 目の周辺と口の特徴(eye-mouth descriptor)は、FERでは59.1%のF1スコアを達成し、全体顔特徴を上回ったが、FRタスクでは45.5%のKNN正答率に留まり、感情的コンテンツが強い領域が表現学習に有効であることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。