Skip to main content
QUICK REVIEW

[論文レビュー] Transfer Learning for Action Unit Recognition

Yen Khye Lim, Zukang Liao|arXiv (Cornell University)|Jul 19, 2018
Face and Expression Recognition参考文献 9被引用数 5
ひとこと要約

本稿では、VGG-Face や ResNet-152 などの事前学習済み畳み込みニューラルネットワーク(CNN)を用いて、顔の行動単位(AU)認識のための転移学習ベースのアンサンブルフレームワークを提案する。特徴抽出、ファインチューニング、領域ベースの入力、および分類器アンサンブル(特にSVMとLSTM)を組み合わせることで、DISFAデータセット上で74.1%という最先端のF1スコアを達成し、個々のモデルを著しく上回る性能を発揮した。

ABSTRACT

This paper presents a classifier ensemble for Facial Expression Recognition (FER) based on models derived from transfer learning. The main experimentation work is conducted for facial action unit detection using feature extraction and fine-tuning convolutional neural networks (CNNs). Several classifiers for extracted CNN codes such as Linear Discriminant Analysis (LDA), Support Vector Machines (SVMs) and Long Short-Term Memory (LSTM) are compared and evaluated. Multi-model ensembles are also used to further improve the performance. We have found that VGG-Face and ResNet are the relatively optimal pre-trained models for action unit recognition using feature extraction and the ensemble of VGG-Net variants and ResNet achieves the best result.

研究の動機と目的

  • 事前学習済みの深層CNNを用いた転移学習により、顔の行動単位認識の精度を向上させること。
  • DISFAデータセットにおけるAU検出に向けた、さまざまなCNNアーキテクチャ(例:VGG-Face、ResNet)の有効性を評価すること。
  • ファインチューニング、領域ベースの特徴抽出、分類器アンサンブルの影響がAU認識性能に与える影響を調査すること。
  • LDA、SVM、LSTM分類器がCNN埋め込み特徴に適用された際の性能を比較すること。
  • AU認識のF1スコアを最大化するための、モデルと技術の最適な組み合わせを特定すること。

提案手法

  • DISFAデータセットの顔画像から特徴抽出のために、事前学習済みCNN(例:VGG-Face、ResNet-152)を活用する。
  • VGG-FastおよびResNet-152の最終全結合層をAU認識タスクに合わせてファインチューニングすることで、転移学習を適用する。
  • 特定のAUに対応する顔領域を事前にセグメンテーションし、それらをCNNに供給する領域ベースのアプローチを実装する。
  • 抽出されたCNN特徴量を用いて、LDA、SVM、LSTMの複数の分類器を訓練し、AU認識性能を比較する。
  • 特徴抽出とファインチューニング済みネットワークからの複数のモデルおよび分類器のメジャー投票を用いてアンサンブルモデルを構築する。
  • 性能が低いモデル(例:AlexNet)を性能の高いファインチューニング済みモデルに置き換えることで、アンサンブルの最適化を図る。

実験結果

リサーチクエスチョン

  • RQ1特徴抽出に用いる際、どの事前学習済みCNNアーキテクチャが行動単位認識で最高の性能を発揮するか?
  • RQ2静的特徴抽出と比較して、事前学習済みCNNのファインチューニングがAU認識精度をどの程度向上させるか?
  • RQ3AU特化型の顔領域を用いることで、認識性能がどの程度向上するか?
  • RQ4LDA、SVM、LSTMといった異なる分類器が、CNN埋め込み特徴に適用された際の性能はどのように異なるか?
  • RQ5特徴抽出とファインチューニング済みネットワークからの多様なモデルのアンサンブルは、個々のモデルよりも優れた性能を発揮できるか?

主な発見

  • SVMを用いた特徴抽出ベースのAU認識において、VGG-FaceとResNet-152が最高のF1スコア(それぞれ60.7%および58.7%)を達成した。
  • VGG-Fastのファインチューニングにより、fc6層の特徴量を用いたSVM分類器のF1スコアが56.2%から62.9%に向上し、タスク特化型の適応による利点が明確になった。
  • 領域ベースのアプローチにより、グローバル画像入力と比較してF1スコアが2.9%向上し、ファインチューニング済みVGG-FastではAU特化領域で68.5%のF1スコアを達成した。
  • 特徴抽出からのみ構成されるアンサンブルモデルは68.8%のF1スコアを達成し、個々のモデルを上回った。
  • 特徴抽出モデルとファインチューニング済みモデルを組み合わせたハイブリッドアンサンブルは、F1スコアを71.1%まで向上させ、モデル多様性の価値を示した。
  • 顔領域をセグメンテーションして訓練されたモデルを統合した最適なアンサンブルは、74.1%という最先端のF1スコアを達成し、最高の単一モデル(ファインチューニング済みVGG-Fast)の5.6%上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。