Skip to main content
QUICK REVIEW

[論文レビュー] Continuous Multimodal Emotion Recognition Approach for AVEC 2017

Narotam Singh, Nittin D. Singh|arXiv (Cornell University)|Sep 18, 2017
Music and Audio Processing参考文献 22被引用数 4
ひとこと要約

この論文は、音声および視覚特徴(HOG、SIFT-GMM Fisherベクトル、VGG-Face、ResNet-50特徴)をニューラルネットワーク回帰によって統合することで、AVEC 2017用の連続的マルチモodal感情認識システムを提案している。最良のマルチモーダル統合では、発達セットにおけるアーザルのCCCが0.525、バレンスのCCCが0.507に達したが、テストセットでは性能が低く、過学習またはドメインシフトの可能性を示唆している。

ABSTRACT

This paper reports the analysis of audio and visual features in predicting the continuous emotion dimensions under the seventh Audio/Visual Emotion Challenge (AVEC 2017), which was done as part of a B.Tech. 2nd year internship project. For visual features we used the HOG (Histogram of Gradients) features, Fisher encodings of SIFT (Scale-Invariant Feature Transform) features based on Gaussian mixture model (GMM) and some pretrained Convolutional Neural Network layers as features; all these extracted for each video clip. For audio features we used the Bag-of-audio-words (BoAW) representation of the LLDs (low-level descriptors) generated by openXBOW provided by the organisers of the event. Then we trained fully connected neural network regression model on the dataset for all these different modalities. We applied multimodal fusion on the output models to get the Concordance correlation coefficient on Development set as well as Test set.

研究の動機と目的

  • AVEC 2017チャレンジ用の連続的感情認識システムを、マルチモーダル音声および視覚特徴を用いて開発すること。
  • ハンドクラフトされた視覚特徴(HOG、SIFT-GMM)とディープラーニング特徴(VGG-Face、ResNet-50)が連続的感情次元を予測する効果を評価すること。
  • 音声および視覚特徴のマルチモーダル統合が、アーザル、バレンス、および好みの回帰性能に与える影響を調査すること。
  • 発達セットおよびテストセットにおけるコンcordance相関係数(CCC)の観点から、単モーダルおよびマルチモーダルモデルを比較すること。

提案手法

  • 勾配のヒストグラムを用いて、動画フレーム内の顔領域からHOG特徴を抽出した。
  • SIFT特徴を計算し、GMMベースのフィッシャーベクトル符号化を適用して時系列モデリングを行い、次に次元削減のためPCAを適用して4508次元にした。
  • 事前学習済みのVGG-FaceおよびResNet-50-dagモデルを用い、それぞれ35番目および174番目の層の活性化を深層視覚特徴として抽出した。
  • 23個の低レベル特徴量(LLD)から、openXBOWを用いて音声Bag-of-audio-words(BoAW)表現を生成し、学習には6秒のブロックサイズを用いた。
  • アーザル、バレンス、好みの回帰のため、ReLU活性化関数(出力層を除く)を用いた全結合フィードフォワードニューラルネットワークを訓練した。
  • 単モーダル予測をエアリーまたはレイト統合戦略を用いて統合し、発達セットおよびテストセットにおける性能をCCCで評価した。

実験結果

リサーチクエスチョン

  • RQ1ハンドクラフトされた視覚特徴(HOG、SIFT-GMM)とディープラーニングベースの視覚特徴(VGG-Face、ResNet-50)は、連続的感情次元を予測する上で、どのように比較されるか?
  • RQ2音声のみの特徴(LLDのBoAW)は、視覚的およびマルチモーダルモデルと比較して、アーザル、バレンス、好みを予測する上でどの程度の性能を示すか?
  • RQ3音声および視覚特徴のマルチモーダル統合は、単モーダルベースラインと比較して、AVEC 2017データセットにおける回帰性能を向上させるか?
  • RQ4モデルの複雑さ(例:より深いネットワーク)は、連続的感情回帰における性能および計算コストにどのように影響するか?
  • RQ5統合における特徴固有の重みは、異なる感情次元の予測にどの程度の影響を及えるか?

主な発見

  • マルチモーダル統合モデルは、発達セットで最高のCCCを達成した:アーザルが0.525、バレンスが0.507で、単モーダルモデルを上回った。
  • HOG特徴は視覚的特徴の中で最高の単モーダル性能を示し、発達セットにおけるアーザルのCCCが0.289、バレンスのCCCが0.310であった。
  • VGG-Face特徴は、アーザルのCCCが0.277、バレンスのCCCが0.336で、ResNet-50特徴(それぞれ0.165および0.274)を上回った。
  • SIFT-GMMフィッシャーベクトルは性能が低く、アーザルのCCCがわずか0.075、バレンスのCCCが0.123に留まり、この設定下での判別力に欠けることが示唆された。
  • テストセットでは、マルチモーダルモデルがアーザルのCCCを0.306、バレンスのCCCを0.466に達したが、発達セットと比較して顕著な性能低下が見られた。
  • テストセットにおけるマルチモーダルモデルの線形相関係数は、アーザルが0.361、バレンスが0.437であり、CCCが低くても中程度の予測能力を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。