[論文レビュー] Facial Expression Recognition Using Human to Animated-Character Expression Translation
本稿では、人間の顔の表情を固定されたアニメーションキャラクターのアイデンティティに変換する条件付き GAN、HA-GAN を提案する。この手法により、被験者間のばらつきが低減され、純粋でスタイリッシュな表情が生成される。FERGDB データセットを用いて訓練することで、時間的情報を用いない静的画像における FER の精度が向上し、最先端の性能を達成する。
Facial expression recognition is a challenging task due to two major problems: the presence of inter-subject variations in facial expression recognition dataset and impure expressions posed by human subjects. In this paper we present a novel Human-to-Animation conditional Generative Adversarial Network (HA-GAN) to overcome these two problems by using many (human faces) to one (animated face) mapping. Specifically, for any given input human expression image, our HA-GAN transfers the expression information from the input image to a fixed animated identity. Stylized animated characters from the Facial Expression Research Group-Database (FERGDB) are used for the generation of fixed identity. By learning this many-to-one identity mapping function using our proposed HA-GAN, the effect of inter-subject variations can be reduced in Facial Expression Recognition(FER). We also argue that the expressions in the generated animated images are pure expressions and since FER is performed on these generated images, the performance of facial expression recognition is improved. Our initial experimental results on the state-of-the-art datasets show that facial expression recognition carried out on the generated animated images using our HA-GAN framework outperforms the baseline deep neural network and produces comparable or even better results than the state-of-the-art methods for facial expression recognition.
研究の動機と目的
- 顔の表情認識(FER)データセットにおける被験者間のばらつきを軽減し、未学習の被験者に対するモデルの一般化性能を向上させること。
- ポーズされたデータセットにおける不純で一貫性のない顔の表情の問題を軽減し、正確な FER を妨げる要因を排除すること。
- 訓練用に、純粋で専門家が設計した表情を持つリアルなアニメーション画像を生成することで、FER の性能を向上させること。
- 多様な人間の顔から単一のアニメーションアイデンティティへのマッピングを可能にし、アイデンティティに依存しない FER を実現すること。
- 3Dリグデータや動画シーケンスを必要としないデータ拡張フレームワークを提供すること。
提案手法
- 多様な人間の顔の表情画像から固定されたアニメーションキャラクターのアイデンティティへのマッピングを学習する、条件付き GAN フレームワーク、HA-GAN を開発する。
- 生成ネットワークは、FERGDB データセットを用い、入力された人間の画像から表情の詳細を事前に定義されたアニメーション顔に移す。FERGDB データセットには、熟練して作成された純粋な表情のアニメーションが含まれる。
- 識別ネットワークは、本物のアニメーション画像と生成された画像を区別するように学習され、写真のようなリアルさと表情の正確性を保証する。
- 敵対的損失と知覚的損失を用いて、顔の構造と表情の詳細を保持するように、エンド・トゥ・エンドでモデルを訓練する。
- 生成されたアニメーション画像上で FER を実行し、その画像を微調整用の深層畳み込みニューラルネットワーク分類器の学習データとして使用する。
- 未学習の被験者に対する一般化性能を評価するため、アイデンティティに依存しない分割を用いた交差検証を実施する。
実験結果
リサーチクエスチョン
- RQ1人間の顔から固定されたアニメーションアイデンティティへの多対一マッピングは、FER における被験者間のばらつきの影響を軽減できるか?
- RQ2アニメーションで生成された純粋でアーティストが設計した表情は、実際の人間の画像と比較して FER の精度を向上させるか?
- RQ3GAN ベースの翻訳フレームワークは、人間の入力から表情の意味を保持したリアルなアニメーション表情を生成できるか?
- RQ4生成されたアニメーション画像における FER の性能は、静的画像ベンチマークにおける最先端手法と比較してどうか?
- RQ5本手法は、動画シーケンスや時間的情報を用いずに高い精度を達成できるか?
主な発見
- CK+ データセットでは、HA-GAN は6種類の表情分類で96.14%の精度を達成し、CNN ベースライン(92.45%)を上回り、最先端の手法と同等かそれ以上の性能を示した。
- MMI データセットでは、HA-GAN は71.87%の精度を達成し、ベースラインの CNN(58.46%)を著しく上回り、DeRL などの高度な静的手法(73.23%)と同等の性能を示した。
- Oulu-CASIA データセットでは、HA-GAN は88.26%の精度を達成し、ベースラインの CNN(73.14%)を上回り、時間的情報を使用しないにもかかわらず、LBP-TOP や HOG 3D といった動的手法をも凌駆した。
- 結果から、生成されたアニメーション画像における FER が、実際の人間の画像における FER よりも高い精度を達成していることが示され、純粋な表情が認識を向上させるという仮説が裏付けられた。
- 本手法は、動画データや複雑な時間的モデリングに依存せず、静的画像ベンチマークで最先端の性能を達成した。
- HA-GAN の成功は、合成的でスタイリッシュな表情が、特にデータが少ない、または被験者間のアイデンティティのばらつきが大きい状況において、FER のための効果的なデータ拡張として機能できることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。