[論文レビュー] Learning to Augment Expressions for Few-shot Fine-grained Facial Expression Recognition
本稿では、54のカテゴリと219,719枚の画像を備えた大規模で細分化された顔の感情表現データセットF²EDと、表情とポーズを別々に制御することで、高品質でアイデンティティを保持する顔の画像を生成するコンポジショナルGANフレームワークComp-GANを提案する。本手法は、1つの新しいクラスあたり1枚の訓練画像でのみ学習する少サンプル顔の感情認識タスクにおいて、平均44.19%の正確度を達成し、ベースラインのLightCNNを5.25ポイント上回る。
Affective computing and cognitive theory are widely used in modern human-computer interaction scenarios. Human faces, as the most prominent and easily accessible features, have attracted great attention from researchers. Since humans have rich emotions and developed musculature, there exist a lot of fine-grained expressions in real-world applications. However, it is extremely time-consuming to collect and annotate a large number of facial images, of which may even require psychologists to correctly categorize them. To the best of our knowledge, the existing expression datasets are only limited to several basic facial expressions, which are not sufficient to support our ambitions in developing successful human-computer interaction systems. To this end, a novel Fine-grained Facial Expression Database - F2ED is contributed in this paper, and it includes more than 200k images with 54 facial expressions from 119 persons. Considering the phenomenon of uneven data distribution and lack of samples is common in real-world scenarios, we further evaluate several tasks of few-shot expression learning by virtue of our F2ED, which are to recognize the facial expressions given only few training instances. These tasks mimic human performance to learn robust and general representation from few examples. To address such few-shot tasks, we propose a unified task-driven framework - Compositional Generative Adversarial Network (Comp-GAN) learning to synthesize facial images and thus augmenting the instances of few-shot expression classes. Extensive experiments are conducted on F2ED and existing facial expression datasets, i.e., JAFFE and FER2013, to validate the efficacy of our F2ED in pre-training facial expression recognition network and the effectiveness of our proposed approach Comp-GAN to improve the performance of few-shot recognition tasks.
研究の動機と目的
- 既存の顔の感情表現データセットにおける不足と多様性の欠如、特に細分化されたおよび微細な表情の観点から課題を解決すること。
- 最小限のラベル付き訓練データで頑健な顔の感情認識を可能にする少サンプル学習フレームワークの開発。
- 不足している表情カテゴリを補完するために、現実的でアイデンティティを保持する顔の画像を生成すること。
- 提案されたデータセットと生成フレームワークの有効性を、実世界の少サンプル認識ベンチマーク上で検証すること。
提案手法
- 54の細分化された顔の感情表現カテゴリ、119人の被験者、4つのポーズ、心理的専門家によるアノテーションを備えた制御可能で大規模なデータセットF²EDを提案する。
- 表情の編集とポーズの変更のための2つの分離生成器を備えた統合型生成対抗ネットワークであるComp-GANを設計する。
- 生成器は参照画像に基づいて条件付きに画像を生成し、アイデンティティを保持しながら表情とポーズを独立して変更する。
- 実用性とアイデンティティ保持を保証するため、敵対的損失、アイデンティティ一貫性損失、知覚的損失を用いた条件付きGANアーキテクチャを採用する。
- エンドツーエンドで学習し、少サンプル学習の文脈におけるデータ拡張用に多様で高精細な画像を合成する。
- 既存のデータセット(FER2013とJAFFE)上で事前学習されたモデルを微調整することで、汎化性と転移性を示す。
実験結果
リサーチクエスチョン
- RQ154のカテゴリを有する大規模で細分化された顔の感情表現データセットF²EDは、顔の感情認識データセットの多様性と現実性を顕著に向上させるか?
- RQ2Comp-GANは、表情とポーズを変更しながらアイデンティティを保持する現実的な顔の画像を効果的に生成できるか?
- RQ3Comp-GANによるデータ拡張は、少サンプル顔の感情認識性能をどの程度向上させるか?
- RQ4F²EDで事前学習したモデルは、FER2013 や JAFFE といった既存のベンチマークデータセットへの転移性能を向上させるか?
- RQ5表情とポーズの分離生成は、少サンプル認識モデルの汎化性と頑健性にどの程度寄与するか?
主な発見
- Comp-GANは、1つの新しいクラスあたり1枚の訓練画像でのみ学習するER-FE少サンプル設定において、平均44.19%の正確度を達成し、ベースラインのLightCNNを5.25ポイント上回る。
- ポーズと表情の生成を組み合わせたアプローチ(LightCNN + G(Pose) + G(Exp))が最良の性能を示し、LightCNN単体に比べ4.95%の向上を達成した。
- 1クラスあたり10枚の画像を生成すると正確度は44.19%に上昇し、1000枚に増やすとk=5の設定で57.14%にまで上昇する。これはスケーラビリティの高さを示している。
- t-SNE可視化により、生成画像が同じアイデンティティのオリジナル画像と密にクラスタリングされていることが確認され、アイデンティティの保持が有効に実現されていることが示された。
- F²EDで事前学習したモデルはFER2013とJAFFEに良好に一般化され、このデータセットの事前学習価値を裏付けた。
- 同等のGAN手法であるAttGANは、同じ設定で40.14%の正確度にとどまり、Comp-GANの優位性を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。