[論文レビュー] Revisiting Few-Shot Learning for Facial Expression Recognition
本稿は、顔の表情認識(FER)における少数ショット学習を再検討し、ベースクラスとネイティブクラスが異なるデータセットに由来し、顕著なドメインシフトを示す現実的なクロスドメイン設定下でメタラーニング手法の性能を評価する。既存の少数ショットモデルが高いクラス内変動と大きなドメインギャップに対して苦労することを示し、モデル容量の増大とドメインギャップの低減により性能が向上することを明らかにした。特に、RAF-basicから微調整された場合、CK+で5-way 5-shot設定で最大84.90%の正確度を達成した。
Most of the existing deep neural nets on automatic facial expression recognition focus on a set of predefined emotion classes, where the amount of training data has the biggest impact on performance. However, in the standard setting over-parameterised neural networks are not amenable for learning from few samples as they can quickly over-fit. In addition, these approaches do not have such a strong generalisation ability to identify a new category, where the data of each category is too limited and significant variations exist in the expression within the same semantic category. We embrace these challenges and formulate the problem as a low-shot learning, where once the base classifier is deployed, it must rapidly adapt to recognise novel classes using a few samples. In this paper, we revisit and compare existing few-shot learning methods for the low-shot facial expression recognition in terms of their generalisation ability via episode-training. In particular, we extend our analysis on the cross-domain generalisation, where training and test tasks are not drawn from the same distribution. We demonstrate the efficacy of low-shot learning methods through extensive experiments.
研究の動機と目的
- 大規模なアノテート済みデータが不足し、クラス分布が著しく不均衡な現実世界のシナリオにおける顔の表情認識の課題に対処すること。
- ベースクラスとは異なる分布を持つデータセットからネイティブクラスが抽出される現実的なクロスドメイン設定下で、FERにおける少数ショット学習手法を評価すること。
- クラス内変動とドメインシフトが、顔の表情認識における少数ショット学習アルゴリズムの一般化能力に与える影響を調査すること。
- 少しだけの訓練サンプルで新しい顔の表情カテゴリに効果的に一般化できる少数ショット学習モデルが成立する条件を同定すること。
提案手法
- 著者らは、少数ショット学習の枠組みを採用し、モデルをminiImageNetのベースクラスで学習し、RAF-basicおよびCK+データセットのネイティブクラスでテストする。
- 6種類のメタラーニング手法(Baseline, Baseline++, ProtoNet, MatchingNet, RelationNet, SubspaceNet)を評価し、バックボーンネットワークとしてResNet18を用いる。
- エピソードベースの学習を採用して、少数ショット推論をシミュレートする。各エピソードには、各クラスの少数のサンプルから成るサポートセットと、未見のサンプルから成るクエリセットが含まれる。
- 2つのクロスドメインシナリオ(miniImageNet → RAF-basic および miniImageNet → CK+)と、狭いドメインギャップシナリオ(RAF-basic → CK+)の下で性能を評価する。
- クラス内変動を低減するために、著者らはProtoNetおよびSubspaceNetで特徴量の平均化を適用し、メトリック学習を用いてサポートとクエリの埋め込みを比較する。
- 1-shotおよび5-shot設定を5-way分類タスクで実施し、複数のランダムシードでの平均をとる。
実験結果
リサーチクエスチョン
- RQ1ネイティブクラスがベースクラスとは異なるドメインに由来する場合、既存の少数ショット学習手法はどの程度一般化するか?
- RQ2ネイティブクラスデータセットにおけるクラス内変動が、顔の表情認識における少数ショット学習モデルの性能に与える影響は何か?
- RQ3現実世界の顔の表情認識シナリオで一般的な大きなドメインシフト下でも、少数ショット学習モデルは効果的に一般化できるか?
- RQ4モデル容量の増大またはドメインギャップの低減は、顔の表情認識における少数ショット一般化を改善するか?
主な発見
- miniImageNet → RAF-basicのクロスドメイン設定では、すべての少数ショット手法が性能を発揮せず、SubspaceNetですら1-shotで23.93%、5-shotで30.95%の正確度にとどまり、大きなドメインシフト下での一般化能力の低さが示された。
- miniImageNet → CK+の設定では、SubspaceNetが1-shotで40.77%、5-shotで54.61%の正確度を達成し、他の手法よりも優れており、特に低ショット条件下で顕著な性能を示した。
- RAF-basic → CK+の狭いドメインギャップシナリオでは、Baseline++が5-shotで最高の85.30%の正確度を記録し、すべてのメタラーニング手法を上回った。これは、データ拡張や特徴正則化が、ドメインギャップが小さい場合にはメタラーニングよりも効果的である可能性を示唆している。
- ProtoNetは、miniImageNet → CK+の5-way 1-shot設定で最高の性能を示し、39.12%の正確度を達成した。これは、クラスプロトタイプの平均化によりクラス内変動が低減されたためと考えられる。
- MatchingNetは、すべての設定で一貫して低性能であり、45%未満の正確度にとどまり、クラス内でのサンプル間関係をモデル化しない平均コサイン距離依存のためである。
- miniImageNet → CK+の混同行列から、モデルが類似した表情(例:『恐れ』と『驚き』)を区別するのが困難であることが明らかになった。特にドメインシフトが大きい場合には顕著であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。