Skip to main content
QUICK REVIEW

[論文レビュー] Fusion with Hierarchical Graphs for Mulitmodal Emotion Recognition

Shuyun Tang, Zhaojie Luo|arXiv (Cornell University)|Sep 15, 2021
Emotion and Mood Recognition参考文献 38被引用数 4
ひとこと要約

本稿では、注意に基づくエッジ重みと関係性を有するグラフ変換を用いた二段階のグラフ構築により、モダリティ間相互作用およびモダリティ-感情関係を捉える、グラフベースの新規モデルである階層的フラクショナルグラフ畳み込みネットワーク(HFGCN)を提案する。HFGCNは、マルチタスク学習により感情ラベルとValence-Arousal(VA)度を同時に予測することで、IEMOCAPおよびMELDデータセットで最先端の性能を達成し、精度と解釈可能性の両方を向上させる。

ABSTRACT

Automatic emotion recognition (AER) based on enriched multimodal inputs, including text, speech, and visual clues, is crucial in the development of emotionally intelligent machines. Although complex modality relationships have been proven effective for AER, they are still largely underexplored because previous works predominantly relied on various fusion mechanisms with simply concatenated features to learn multimodal representations for emotion classification. This paper proposes a novel hierarchical fusion graph convolutional network (HFGCN) model that learns more informative multimodal representations by considering the modality dependencies during the feature fusion procedure. Specifically, the proposed model fuses multimodality inputs using a two-stage graph construction approach and encodes the modality dependencies into the conversation representation. We verified the interpretable capabilities of the proposed method by projecting the emotional states to a 2D valence-arousal (VA) subspace. Extensive experiments showed the effectiveness of our proposed model for more accurate AER, which yielded state-of-the-art results on two public datasets, IEMOCAP and MELD.

研究の動機と目的

  • 従来の統合手法が単純な連結に依存し、マルチモーダル感情認識において複雑なモダリティ間相互作用をモデル化できないという限界に対処すること。
  • 各モダリティの寄与度が感情タイプによって異なるというモダリティ-感情関係が、分類性能をどのように向上させるかを調査すること。
  • 感情状態を2次元のValence-Arousal(VA)部分空間に射影することで、モデルの解釈可能性を向上させること。
  • 発話レベルおよび会話レベルのモダリティ相互作用を捉える階層的グラフ統合メカニズムを開発すること。

提案手法

  • モデルは二段階のグラフ構築を用いる:まず、テキスト、音声、映像といったモダリティ固有の特徴が、注意に基づくエッジによって接続され、発話レベルでのモダリティ間相互作用をモデル化する。
  • 第二に、発話表現同士が別の注意に基づくエッジで接続され、時間軸にわたる階層的統合を可能にする会話レベルの相互作用をモデル化する。
  • エッジ関係は、モダリティ-感情依存性を明示的に表現するように設計されており、モデルが異なる感情状態における各モダリティの寄与度を学習できるようにする。
  • 表現学習と解釈可能性の向上を図るため、離散的である感情ラベルと連続的であるValence-Arousal(VA)度を同時に予測するマルチタスク学習損失を導入する。
  • 会話全体にわたるモダリティと感情の動的関係を捉えるために、関係性を有するグラフ変換が適用される。
  • 学習可能な注意重みを備えたグラフ畳み込みネットワーク(GCNs)を活用し、モダリティ相互作用および関係性エッジへの重要度を動的に割り当てる。

実験結果

リサーチクエスチョン

  • RQ1従来の早期統合や後期統合手法と比較して、階層的グラフ統合はマルチモーダル表現学習における感情認識にどのように寄与するか?
  • RQ2各モダリティの重要度が感情タイプによって変化するというモダリティ-感情関係は、分類性能をどの程度向上させるか?
  • RQ3離散的である感情ラベルと連続的であるValence-Arousal(VA)度を同時に予測することで、モデルの精度と解釈可能性が向上するか?
  • RQ4注意に基づくエッジ重みと関係性を有するグラフ設計は、モダリティ間相互作用およびモダリティ-感情依存性をどのように捉えるか?
  • RQ5発話レベルと会話レベルのグラフ構造の相対的寄与度は、マルチモーダル感情ダイナミクスのモデル化においてどのように異なるか?

主な発見

  • HFGCNは、平均F1スコア74.90を達成し、IEMOCAPデータセットでベースライン手法を著しく上回る最先端の性能を示した。
  • アブレーションスタディの結果、グラフ構築の両ステージを削除するとF1スコアが12ポイント以上低下し、階層的統合の必要性が裏付けられた。
  • 注意に基づくエッジ重みを削除するとF1スコアが2.7%低下し、エッジ関係を削除すると3.9%低下したため、関係性設計が注意重み単体よりも重要であることが示された。
  • 2次元のValence-Arousal(VA)空間における可視化から、モデルは一般的な感情分布を捉えているが、アーザルの軸に沿って過剰に一般化している傾向があることがわかった。
  • 短い発話、たとえば'Okay' や 'I just can’t' は、ニュートラル、怒り、興奮の間の遷移領域に位置するため、誤分類が最も多く発生した。
  • 感情ラベルとVA度の共同予測により、予測された感情状態が理論的VAフレームワーク(Barrett, 1998)と整合していることから、モデルの解釈可能性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。