Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Local-Global Ranking Fusion for Emotion Recognition

Paul Pu Liang, Amir Zadeh|arXiv (Cornell University)|Aug 12, 2018
Emotion and Mood Recognition参考文献 30被引用数 4
ひとこと要約

本論文では、動画の各セグメント間の感情強度変化の相対的ランク付けと、絶対的感情ラベルの直接予測を組み合わせることで、マルチモーダル感情認識のための新規手法であるMultimodal Local-Global Ranking Fusion (MLRF)を提案する。ローカルランク付け、ベイジアン推論によるグローバルランク付け、および直接的・相対的融合の3段階に分けて処理することで、AVEC16ベンチマークで最先端の性能を達成し、強力なベースラインを上回って感情のValenceでは最大0.0508、Arousalでは最大0.032のCCCスコア向上を達成した。

ABSTRACT

Emotion recognition is a core research area at the intersection of artificial intelligence and human communication analysis. It is a significant technical challenge since humans display their emotions through complex idiosyncratic combinations of the language, visual and acoustic modalities. In contrast to traditional multimodal fusion techniques, we approach emotion recognition from both direct person-independent and relative person-dependent perspectives. The direct person-independent perspective follows the conventional emotion recognition approach which directly infers absolute emotion labels from observed multimodal features. The relative person-dependent perspective approaches emotion recognition in a relative manner by comparing partial video segments to determine if there was an increase or decrease in emotional intensity. Our proposed model integrates these direct and relative prediction perspectives by dividing the emotion recognition task into three easier subtasks. The first subtask involves a multimodal local ranking of relative emotion intensities between two short segments of a video. The second subtask uses local rankings to infer global relative emotion ranks with a Bayesian ranking algorithm. The third subtask incorporates both direct predictions from observed multimodal behaviors and relative emotion ranks from local-global rankings for final emotion prediction. Our approach displays excellent performance on an audio-visual emotion recognition benchmark and improves over other algorithms for multimodal fusion.

研究の動機と目的

  • 人物に依存しない(絶対的)および人物に依存する(相対的)感情表現パターンを統合することで、マルチモーダル感情認識の課題に取り組む。
  • 動画セグメント同士のペアワイズ比較を通じて感情強度の変化をモデル化することで、音声・映像感情認識ベンチマークの性能を向上させる。
  • 絶対的感情ラベル付けよりも学習が容易な相対的ランク付け信号を活用することで、複雑なディープアーキテクチャへの依存を低減する。
  • 直接予測と相対的ランク付け推定を組み合わせることで、単独で用いる場合よりも優れた性能が得られることを示すこと。

提案手法

  • モデルは、2つの短いランダムに抽出された動画セグメントを比較し、感情強度が増加したか減少したかを判断することで、マルチモーダルなローカルランク付けを実行する。
  • ローカルランクはベイジアンスキルレーティングアルゴリズムを用いて集約され、全動画にわたるグローバルな相対的感情ランクが推定される。
  • 直接的な感情予測は、マルチモーダル特徴(音声、視覚)を用いてベースモデル(例:EF-LSTM)から得られるが、相対的ランクはグローバルランク付けステップから導出される。
  • ラテント・フェージョン機構により、直接予測と相対的ランク付けが統合され、最終的な感情強度推定値が生成される。
  • ローカル比較ペア数(k)とセグメント抽出用のウィンドウサイズ(w)は設定可能であり、デフォルト設定はw=200、k=500または1000である。
  • フレームワークはエンド・ツー・エンドで学習され、ArousalおよびValenceの回帰評価にコンcordance correlation coefficient(CCC)を用いて、AVEC16データセットで評価される。

実験結果

リサーチクエスチョン

  • RQ1短い動画セグメント間の感情強度の相対的比較は、マルチモーダル感情認識の性能向上に寄与するか?
  • RQ2直接的な絶対的感情予測と相対的ランク付け信号を融合させることで、単独で用いる場合よりも優れた性能が得られるか?
  • RQ3ローカル比較ペア数とウィンドウサイズの変更が、グローバルランク付けの品質および最終的な感情認識性能に与える影響は何か?
  • RQ4ランク付けに基づく監視信号を用いる単純なモデルは、Gated-LSTM や MV-LSTM などのより複雑なアーキテクチャを上回る性能を発揮できるか?

主な発見

  • MLRF-1000は、AVEC16データセットでArousalで0.5049、Valenceで0.5432のCCCを達成し、すべてのベースラインを上回った。
  • 最高のベースライン(MV-LSTM fully connected)を上回る改善が、Arousalで0.032、Valenceで0.0508のスコア向上として確認され、顕著な向上が示された。
  • ローカル比較ペア数を500から1000に増加させることで性能向上が確認され、より多くのローカルランク付けがグローバルランク推定を向上させることを示した。
  • ウィンドウサイズをw=200にすると、w=10、50、100よりも顕著に性能が向上した。これは、より長い時間的文脈がマルチモーダルダイナミクスを捉えるために不可欠であることを示している。
  • アブレーションスタディにより、直接的および相対的予測の両方を融合することが不可欠であることが確認された。相対的予測のみを用いた場合、ValenceでCCC=0.0402と非常に低い性能にとどまったが、直接予測のみの場合はすでに高いが最適でない性能を示した。
  • 複雑なアーキテクチャを用いずに最先端の結果を達成した。これは、相対的ランク付け信号がマルチモーダル学習において非常に効果的かつ効率的である可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。