Skip to main content
QUICK REVIEW

[論文レビュー] MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation

Jingwen Hu, Yuchen Liu|arXiv (Cornell University)|Jul 14, 2021
Sentiment Analysis and Opinion Mining参考文献 25被引用数 5
ひとこと要約

この論文では、会話における長距離の文脈的依存関係と話者固有のダイナミクスをモデル化しながら、複数モダリティ(テキスト、音声、視覚)の特徴を統合する深層グラフ畳み込みネットワークMMGCNを提案する。マルチモーダルグラフを構築し、モダリティ間および話者に配慮した接続を設け、残差接続を備えた深層スペクトルGCNを用いることで、IEMOCAP(66.22%の正確性)およびMELD(58.65%の正確性)で最先端の性能を達成し、従来手法を顕著に上回る。

ABSTRACT

Emotion recognition in conversation (ERC) is a crucial component in affective dialogue systems, which helps the system understand users' emotions and generate empathetic responses. However, most works focus on modeling speaker and contextual information primarily on the textual modality or simply leveraging multimodal information through feature concatenation. In order to explore a more effective way of utilizing both multimodal and long-distance contextual information, we propose a new model based on multimodal fused graph convolutional network, MMGCN, in this work. MMGCN can not only make use of multimodal dependencies effectively, but also leverage speaker information to model inter-speaker and intra-speaker dependency. We evaluate our proposed model on two public benchmark datasets, IEMOCAP and MELD, and the results prove the effectiveness of MMGCN, which outperforms other SOTA methods by a significant margin under the multimodal conversation setting.

研究の動機と目的

  • 既存のモデルがマルチスケーラー会話におけるマルチモーダル相互作用と長距離の文脈的依存関係を効果的に捉えることのできない限界を解消すること。
  • 単純な特徴の連結による統合の欠陥を克服し、クロスモダリティ相互作用をモデル化できないこと。
  • 話者IDの情報をグラフ構造に統合して、話者間および話者内依存関係をモデル化すること。
  • 過度な計算コストを伴わずに、より良い表現学習を可能にする深層でスペクトルドメインのGCNアーキテクチャを開発すること。

提案手法

  • MMGCNは、各モダリティ(テキスト、音声、視覚)内で完全結合グラフを構築し、発話間のイントラモダリティ依存関係をモデル化する。
  • 同じ発話を表すノード間のモダリティ間エッジを確立することで、マルチモーダル特徴の相互作用を可能にする。
  • 話者IDは話者埋め込みによって符号化され、グラフに組み込まれ、話者間および話者内依存関係をモデル化する。
  • 残差接続を備えたスペクトルドメインGCNを採用することで、深層ネットワークアーキテクチャ(最大32層)を実現し、特徴学習を向上させる。
  • マルチモーダル統合は、GCN処理の前に行われるエアリー統合により実現され、後期統合やアテンションベースの手法を上回る性能を示す。
  • グラフ畳み込み層は、近接した発話だけでなく、長距離の発話からの文脈的情報を統合する。これは、アテンションヒートマップによっても示されている。

実験結果

リサーチクエスチョン

  • RQ1深層グラフ畳み込みネットワークは、マルチモーダル会話データにおける長距離の文脈的依存関係を効果的にモデル化できるか?
  • RQ2グラフ構造に話者IDを組み込むことで、感情認識性能がどのように向上するか?
  • RQ3グラフベースのマルチモーダル統合機構は、従来の特徴連結やアテンションベースの統合を上回るか?
  • RQ4マルチモーダル会話における感情認識に最適なGCNアーキテクチャの深さは何か?
  • RQ5異なる統合戦略(エアリー統合、後期統合、ゲート付きアテンション、MFN、MulT)をMMGCNフレームワークと組み合わせた場合、どのように比較されるか?

主な発見

  • MMGCNはIEMOCAPデータセットで66.22%の正確性を達成し、次に優れた手法よりも1.5ポイント以上顕著に上回る。
  • MELDデータセットでは58.65%の正確性を達成し、マルチモーダルERC分野で新たな最先端性能を樹立した。
  • アブレーションスタディにより、話者埋め込みを削除すると正確性が著しく低下することが確認された(IEMOCAPで65.76%、p < 0.05)、これがその重要性を裏付けている。
  • MMGCNの最適な深さは4層であり、8層以上では性能がわずかに低下するため、深さと過学習のトレードオフが生じていることが示された。
  • エアリー統合を用いたMMGCNは、両データセットにおいて後期統合、ゲート付きアテンション、MFN、MulTを常に上回り、グラフベースの統合戦略の有効性を確認した。
  • ケーススタディでは、MMGCNが複雑で感情が高揚した会話においても、長距離の発話(例:3番目の発話)に注目していることが示され、強固な文脈モデリング能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。