Skip to main content
QUICK REVIEW

[論文レビュー] Versatile audio-visual learning for emotion recognition

Lucas Goncalves, Seong-Gyun Leem|arXiv (Cornell University)|May 12, 2023
Emotion and Mood Recognition被引用数 7
ひとこと要約

本論文は、回帰(感情的属性)および分類(カテゴリー的感情)の両タスクにおける単モodalおよびマルチモーダル感情認識を統合する、包括的な音声・視覚学習(VAVL)フレームワークを提案する。共有層、共有層上の残差接続、および単モーダル再構成損失を用いることで、音声または視覚データが欠落している場合でも頑健な表現学習が可能となり、CREMA-DおよびMSP-IMPROVデータセットで最先端の性能を達成した。

ABSTRACT

Most current audio-visual emotion recognition models lack the flexibility needed for deployment in practical applications. We envision a multimodal system that works even when only one modality is available and can be implemented interchangeably for either predicting emotional attributes or recognizing categorical emotions. Achieving such flexibility in a multimodal emotion recognition system is difficult due to the inherent challenges in accurately interpreting and integrating varied data sources. It is also a challenge to robustly handle missing or partial information while allowing direct switch between regression or classification tasks. This study proposes a versatile audio-visual learning (VAVL) framework for handling unimodal and multimodal systems for emotion regression or emotion classification tasks. We implement an audio-visual framework that can be trained even when audio and visual paired data is not available for part of the training set (i.e., audio only or only video is present). We achieve this effective representation learning with audio-visual shared layers, residual connections over shared layers, and a unimodal reconstruction task. Our experimental results reveal that our architecture significantly outperforms strong baselines on the CREMA-D, MSP-IMPROV, and CMU-MOSEI corpora. Notably, VAVL attains a new state-of-the-art performance in the emotional attribute prediction task on the MSP-IMPROV corpus.

研究の動機と目的

  • 音声のみ、ビデオのみ、音声・視覚のすべての設定をサポートする統一されたマルチモーダル学習フレームワークの開発。
  • 1つのアーキテクチャ内で感情回帰(例:覚醒度、価値)と分類(例:怒り、喜び)のタスクをシームレスに切り替え可能にする。
  • 学習および推論時にモダリティが欠落または部分的に欠落している状況でも、モデルの頑健性を向上させる。
  • 共有層内に、モダリティ固有の特徴を保持するように、明確に分離された表現を維持する。
  • 現実世界のヒューマンコンピュータインタラクションの場面において、モデルの複雑さを低減しながら性能と解釈可能性を向上させる。

提案手法

  • VAVLフレームワークは、音声および視覚入力に対してそれぞれ独立したモダリティ固有のブランチを設け、その後に共有層を介してクロスモーダル表現を学習する。
  • 訓練の安定化と勾配の流れの改善を目的に、共有層に残差接続を適用する。
  • 単モーダル再構成タスクを導入し、ペアデータが欠落している場合でも、単一モーダルからの意味のある表現学習を促進する。
  • 共有層が音声および視覚モーダルティに対して、明確に分離可能な埋め込みを生成するように訓練され、モダリティ固有の特徴学習が強化される。
  • マルチヘッド予測ヘッドを用いて、感情回帰と分類の両タスクを同時に最適化する。
  • アーキテクチャはエンドツーエンドで訓練され、再訓練なしに単モーダル設定でのゼロショット推論をサポートする。

実験結果

リサーチクエスチョン

  • RQ1統一されたディープラーニングフレームワークは、回帰および分類タスクにおける単モーダルおよびマルチモーダル感情認識を効果的に処理できるか?
  • RQ2推論時に1つのモーダルティのみが利用可能な場合、モデルは高い性能を維持できるか?
  • RQ3共有層に残差接続と再構成タスクを導入することで、マルチモーダル感情認識における表現学習はどの程度向上するか?
  • RQ4提案されたフレームワークは、音声・視覚および単モーダルの両設定で、既存の最先端モデルを上回る性能を示すか?
  • RQ5共有層内に、明確に分離されたモダリティ固有の表現を学習しつつ、効果的なクロスモーダル統合を実現できるか?

主な発見

  • MSP-IMPROVデータセットにおいて、VAVLは音声・視覚回帰タスクでそれぞれ覚醒度(0.856)、価値(0.814)、支配度(0.876)の最先端性能を達成した。
  • MSP-IMPROVの音声のみ設定において、VAVLはすべてのベースラインを上回り、優れた単モーダル表現学習を示した。
  • CREMA-Dデータセットにおいて、VAVLは音声・視覚分類タスクで最高のF1-macro(0.779)およびF1-micro(0.826)スコアを達成した。
  • VAVLの共有層は、ベースラインと比較して、音声および視覚表現間の平均コサイン類似度が顕著に高かったため、モダリティ固有の特徴の分離が良好であった。
  • アブレーションスタディの結果、共有層、残差接続、および単モーダル再構成の各要素が性能向上に顕著な寄与を示した。
  • 部分的にペア化されたデータで訓練された場合でも、モデルは欠落モーダルの状況に強く、頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。