Skip to main content
QUICK REVIEW

[論文レビュー] Pre-Trained Convolutional Neural Network Features for Facial Expression Recognition

Aravind Ravi|arXiv (Cornell University)|Dec 16, 2018
Face and Expression Recognition参考文献 7被引用数 9
ひとこと要約

本論文では、事前学習されたVGG19畳み込みニューラルネットワーク特徴量を用いて顔の感情認識を行う手法を提案している。初期層の特徴量を線形SVM分類器に転送する。CK+およびJAFFEデータセットにおいて、それぞれ92.86%および92.26%の精度を達成し、ImageNetで事前学習された特徴量、特に浅い層からの特徴量が、小さな顔の感情認識データセットへ効果的に転送できることを示している。

ABSTRACT

Facial expression recognition has been an active area in computer vision with application areas including animation, social robots, personalized banking, etc. In this study, we explore the problem of image classification for detecting facial expressions based on features extracted from pre-trained convolutional neural networks trained on ImageNet database. Features are extracted and transferred to a Linear Support Vector Machine for classification. All experiments are performed on two publicly available datasets such as JAFFE and CK+ database. The results show that representations learned from pre-trained networks for a task such as object recognition can be transferred, and used for facial expression recognition. Furthermore, for a small dataset, using features from earlier layers of the VGG19 network provides better classification accuracy. Accuracies of 92.26% and 92.86% were achieved for the CK+ and JAFFE datasets respectively.

研究の動機と目的

  • ImageNetで事前学習されたCNN特徴量が顔の感情認識にどの程度転送可能かを調査すること。
  • 低データ環境下におけるVGG19ネットワークの異なる層の特徴抽出性能を評価すること。
  • 顔の感情分類において、初期層と深層の層のどちらがより効果的かを比較すること。
  • 高精度を達成するために微調整が必要かどうか、あるいは特徴転送のみで十分かを特定すること。

提案手法

  • ImageNetで学習された重みを有する事前学習済みVGG19モデルを用い、顔画像からの特徴量を抽出する。
  • 特に初期の畳み込み層から、VGG19ネットワークの複数の層からの特徴量を抽出する。
  • 抽出された特徴量をフラット化し、線形サポートベクターマシン(SVM)に供給して分類を行う。
  • SVMは、2つの公的顔の感情認識データセット(CK+およびJAFFE)上で訓練および評価される。
  • 異なるデータ分割に対して堅牢な性能推定が得られるよう、交差検証が用いられる。
  • 両データセットにおいて、標準的な正解率指標を用いてモデルの評価が行われる。

実験結果

リサーチクエスチョン

  • RQ1微調整なしで、ImageNetで事前学習されたCNN特徴量が顔の感情認識に効果的に機能するか?
  • RQ2事前学習されたVGG19ネットワークのどの層が、顔の感情認識に最も判別力のある特徴量を生成するか?
  • RQ3ネットワークの初期層を用いることで、小さな顔の感情認識データセットでの性能が向上するか?
  • RQ4一般物体認識タスクから転送された特徴量と、感情固有のデータでエンドツーエンド学習した場合とを比較すると、どちらが優れているか?

主な発見

  • 本モデルは、VGG19ネットワークの初期層からの特徴量を用いて、JAFFEデータセットで92.86%の分類精度を達成した。
  • CK+データセットでは92.26%の精度に到達し、小さなデータセットでも優れた一般化性能を示した。
  • VGG19の初期層からの特徴量が、深層の層からの特徴量よりも優れており、特に低データ環境下で顕著だった。
  • 微調整なしで事前学習済み特徴量を用いることで、競争力のある性能が得られたことから、強力な特徴転送性が裏付けられた。
  • 線形SVM分類器は、CNNが抽出した高レベル表現を効果的に活用し、感情分類に寄与した。
  • 結果から、顔の感情認識において、事前学習済み特徴量を用いた転移学習が実用的で効果的な手法であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。