Skip to main content
QUICK REVIEW

[論文レビュー] Improving Facial Emotion Recognition Systems Using Gradient and Laplacian Images

Ram Krishna Pandey, Souvik Karmakar|arXiv (Cornell University)|Feb 12, 2019
Emotion and Mood Recognition参考文献 28被引用数 9
ひとこと要約

本稿では、畳み込みニューラルネットワーク(CNN)に元の入力に加えて勾配画像およびラプラシアン画像を入力することで、顔の感情認識(FER)システムの性能を向上させる手法を提案している。この手法により、アーキテクチャの複雑さを増すことなく、KDEFおよびFERPlusデータセットで最先端の性能を3–5%向上させた。標準のCNNが生画像から抽出できないエッジおよび強度変化の情報を活用しているため、顔の感情認識の精度が著しく向上する。

ABSTRACT

In this work, we have proposed several enhancements to improve the performance of any facial emotion recognition (FER) system. We believe that the changes in the positions of the fiducial points and the intensities capture the crucial information regarding the emotion of a face image. We propose the use of the gradient and the Laplacian of the input image together with the original input into a convolutional neural network (CNN). These modifications help the network learn additional information from the gradient and Laplacian of the images. However, the plain CNN is not able to extract this information from the raw images. We have performed a number of experiments on two well known datasets KDEF and FERplus. Our approach enhances the already high performance of state-of-the-art FER systems by 3 to 5%.

研究の動機と目的

  • 既存の顔の感情認識(FER)システムの性能を、単純で効果的な画像前処理によって向上させること。
  • 事前に計算された勾配およびラプラシアン画像が、FERにおける深層CNNの特徴抽出をどのように向上させるかを調査すること。
  • 顔の感情に関連する強度および構造的変化をエッジに敏感な画像変換によって捉えることで、手作業によるランドマーク検出への依存を軽減すること。
  • 標準モデルの1/10のパラメータ数で高い精度を維持できる、軽量で効率的なCNNアーキテクチャを開発すること。
  • 勾配およびラプラシアン特徴が標準のCNNによって生画像から本質的に学習可能でないことを実証し、それらを明示的に入力として提供する正当性を示すこと。

提案手法

  • 元の画像に加えて、Sobel演算子を用いて計算された勾配画像(x, y方向)およびラプラシアン画像(2階微分)を入力に追加し、マルチチャネル入力(例:3チャネル:元画像 + 勾配x/y + ラプラシアン)を形成する。
  • 変更されたマルチチャネル画像をCNNに供給し、ネットワークが元の画像と導出された画像表現の両方から同時に学習する。
  • 特徴抽出の向上とモデルの複雑さの低減を図るために、空間変換層(STL)および逆ボトルネックモジュールを用いる。
  • KDEFおよびFERPlusデータセットで複数のモデルを訓練し、元画像、勾配、ラプラシアン、および組み合わせた入力のバリエーションを比較して性能向上を評価する。
  • Adam最適化アルゴリズムを用いてVGG13およびRTNNモデルを再実装し、入力レベルの改良による精度向上を評価する。
  • 深度分離畳み込みおよびグローバル平均プーリング(GAP)を用いて、VGG13の1/13のパラメータ数を持つ軽量モデルを提案し、勾配およびラプラシアン入力で学習させた場合に、同等の精度を達成した。

実験結果

リサーチクエスチョン

  • RQ1CNNの入力に勾配およびラプラシアン画像を追加することで、顔の感情認識の精度を顕著に向上させることができるか?
  • RQ2性能向上は、単にデータ拡張によるものではなく、入力の多様性およびエッジ/テクスチャ情報の豊かさに起因するのか?
  • RQ3勾配およびラプラシアン入力が与えられた場合、軽量なCNNアーキテクチャが大規模モデルと同等の性能を達成できるか?
  • RQ4勾配およびラプラシアン特徴は、生画像からのみの学習で標準のCNNに本質的に学習可能なのか、それとも明示的な入力が必要なのか?
  • RQ5事前に計算されたエッジ特徴の使用により、FERシステムにおける明示的なランドマーク検出の必要性が低下するか?

主な発見

  • 提案手法により、KDEFおよびFERPlusデータセットの両方で最先端のFER性能が3–5%向上し、複数のアーキテクチャで一貫した向上が得られた。
  • Sobelまたはラプラシアン変換を適用し、それらを追加チャネルとして連結することで、入力の多様性が向上し、ベースラインのVGG13に比べて精度が約3%向上した。
  • 元画像、勾配、ラプラシアン画像の3つの並列入力ストリームを備えたRTNNモデルは、元のRTNNよりも高い精度を達成しており、マルチストリーム特徴入力の利点を示している。
  • VGG13の1/13のパラメータ数を持つカスタム軽量CNNは、勾配およびラプラシアン入力で学習させた場合、完全なVGG13モデルと同等の精度を達成した。
  • 結果から、通常のCNNは生画像から勾配およびラプラシアン特徴を効果的に抽出できないことが示され、それらを明示的に入力として提供する正当性が裏付けられた。
  • 導出された画像チャネルにより、有効なデータセットサイズが2–3倍に拡大され、追加のデータ収集なしに一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。