Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Video-based Apparent Personality Recognition Using Long Short-Term Memory and Convolutional Neural Networks

Süleyman Aslan, Uğur Güdükbay|arXiv (Cornell University)|Nov 1, 2019
Personality Traits and Psychology被引用数 14
ひとこと要約

本論文は、ビデオから顕在的グレートファイブ人間性特徴を認識するために、顔貌、環境、音声、および転写特徴をモダリティ固有の畳み込みニューラルネットワーク(CNN)と長短期記憶(LSTM)ネットワークを用いて統合するマルチモーダルディープラーニングフレームワークを提案する。2段階のトレーニングプロセス(まずモダリティ固有のサブネットワークを事前学習し、次に全体モデルを微調整)により、ChaLearn First Impressions V2データセットでSOTAの平均正解率0.9188を達成した。

ABSTRACT

Personality computing and affective computing, where the recognition of personality traits is essential, have gained increasing interest and attention in many research areas recently. We propose a novel approach to recognize the Big Five personality traits of people from videos. Personality and emotion affect the speaking style, facial expressions, body movements, and linguistic factors in social contexts, and they are affected by environmental elements. We develop a multimodal system to recognize apparent personality based on various modalities such as the face, environment, audio, and transcription features. We use modality-specific neural networks that learn to recognize the traits independently and we obtain a final prediction of apparent personality with a feature-level fusion of these networks. We employ pre-trained deep convolutional neural networks such as ResNet and VGGish networks to extract high-level features and Long Short-Term Memory networks to integrate temporal information. We train the large model consisting of modality-specific subnetworks using a two-stage training process. We first train the subnetworks separately and then fine-tune the overall model using these trained networks. We evaluate the proposed method using ChaLearn First Impressions V2 challenge dataset. Our approach obtains the best overall "mean accuracy" score, averaged over five personality traits, compared to the state-of-the-art.

研究の動機と目的

  • ビデオデータからの顕在的パーソナリティ特徴を認識するための堅牢なマルチモーダルフレームワークの開発。
  • 顔貌の表情、環境、音声、および会話の転写といった多様なモダリティを統合する課題に取り組み、統一されたパーソナリティ認識システムを構築すること。
  • LSTMネットワークを用いて動画シーケンス内の時間的ダイナミクスをモデル化することで、性能を向上させること。
  • 特徴レベルの統合を最適化する2段階トレーニング戦略を採用し、正解率を向上させること。
  • ChaLearn First Impressions V2ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • 顔貌および周囲環境特徴にResNet-v2-101、音声特徴にVGGish、転写特徴にELMo埋め込みを用いたモダリティ固有の深層ニューラルネットワークを採用。
  • 顔貌および環境特徴の時間的依存性をモデル化するため6層のLSTMを用い、転写特徴には3層の全結合層を適用。
  • 2段階のトレーニングプロセスを採用:まず各モダリティ固有のサブネットワークを独立して事前学習し、次に特徴レベルの統合を伴う全体モデルを微調整。
  • 顔貌および周囲環境サブネットワークの80次元特徴と、音声および転写サブネットワークの20次元特徴を連結することで特徴レベルの統合を実現。
  • LSTMセル出力を最終層出力に接続するリラクゼーションRNN構造を導入し、勾配の流れを改善し、学習の安定性を向上。
  • 特徴統合と最終予測の前段階で、事前学習済みモデル(ResNet、VGGish、ELMo)を活用して高レベルで意味的に豊かな表現を抽出。

実験結果

リサーチクエスチョン

  • RQ1顔貌、環境、音声、およびテキスト特徴を用いたマルチモーダルディープラーニングフレームワークは、ビデオから顕在的グレートファイブ人間性特徴を効果的に認識できるか?
  • RQ2LSTMによる時間的情報の統合は、静的特徴抽出と比較して、パーソナリティ認識性能にどのように寄与するか?
  • RQ3各モダリティ(顔貌、環境、音声、転写)が最終的なパーソナリティ予測性能に果たす相対的寄与度は何か?
  • RQ4サブネットワークの事前学習 followed でエンドツーエンドの微調整を行う2段階トレーニング戦略は、同時に学習する方法よりも優れた性能をもたらすか?
  • RQ5モダリティ固有の表現の特徴レベル統合は、単一モダリティまたは単純な早期/後期統合アプローチを上回る性能を発揮するか?

主な発見

  • 提案モデルは、ChaLearn First Impressions V2データセットの検証セットで平均正解率0.9188を達成し、過去のすべての最先端手法を上回った。
  • 顔貌特徴に基づくサブネットワークが個別性能で最高を記録し、その後に環境、音声、転写サブネットワークが続く。
  • 周囲環境と音声特徴のマルチモーダル統合により、単一モダリティベースラインを上回る性能が達成され、クロスモダリティ学習の利点が示された。
  • 顔貌および転写特徴を周囲環境-音声モデルに追加することで正解率がさらに向上し、4つのモダリティが相補的であることが確認された。
  • リラクゼーションRNN接続と微調整された事前学習ネットワークを備えた最終的な4特徴統合モデルが、最良の全体的性能を達成した。
  • 4つの性格特徴(勤勉性、外向性、協調性、神経症傾向)に関しては、最高性能を記録するベースラインを上回る結果を得たが、開放性に関してはわずかに性能が低かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。