Skip to main content
QUICK REVIEW

[論文レビュー] S+PAGE: A Speaker and Position-Aware Graph Neural Network Model for Emotion Recognition in Conversation

Liang Chen, Chong Yang|arXiv (Cornell University)|Dec 23, 2021
Emotion and Mood Recognition被引用数 7
ひとこと要約

S+PAGE は、二重スレッド会話トランスフォーマーと位置に敏感なグラフ畳み込みネットワーク(PAG)を用いて、話者IDと発話位置を統合する、会話における感情認識のための新しい図形ニューラルネットワークモデルである。関係的相対的位置符号化とCRFベースのラベル一貫性モデリングを統合することで、自己話者および他話者コンテキストを同時にモデル化し、IEMOCAP(68.72 F1)およびMELD(63.32 F1)で最先端の性能を達成している。

ABSTRACT

Emotion recognition in conversation (ERC) has attracted much attention in recent years for its necessity in widespread applications. Existing ERC methods mostly model the self and inter-speaker context separately, posing a major issue for lacking enough interaction between them. In this paper, we propose a novel Speaker and Position-Aware Graph neural network model for ERC (S+PAGE), which contains three stages to combine the benefits of both Transformer and relational graph convolution network (R-GCN) for better contextual modeling. Firstly, a two-stream conversational Transformer is presented to extract the coarse self and inter-speaker contextual features for each utterance. Then, a speaker and position-aware conversation graph is constructed, and we propose an enhanced R-GCN model, called PAG, to refine the coarse features guided by a relative positional encoding. Finally, both of the features from the former two stages are input into a conditional random field layer to model the emotion transfer.

研究の動機と目的

  • 既存のERCモデルが、自己話者および他話者コンテキストを同時に捉えることの制限を解消すること。
  • 相対的位置符号化をグラフニューラルネットワークに組み込むことで、会話における微細な時間的依存関係のモデリングを改善すること。
  • 文脈モデリング、話者依存性学習、ラベル一貫性モデリングを統合することで、感情認識のパフォーマンスを向上させること。
  • スケーラビリティと耐性を高めた効率的な大規模マルチパーティ会話の処理を可能にすること。

提案手法

  • 注意マスクを備えた二重スレッド会話トランスフォーマー(TSCT)を用いて、粗い自己話者および他話者コンテキスト特徴を抽出する。
  • 発話の順序と話者IDに基づいて、話者および位置に敏感な会話グラフを構築する。
  • 微細な時間的情報を用いて特徴を精緻化するため、関係的相対的位置符号化を備えた強化された関係的GCN(PAG)を提案する。
  • PAGモデルは、メッセージパッシングに話者IDと相対的位置を統合し、長距離依存関係および感情的影響パターンを捉える。
  • 条件付きランダムフィールド(CRF)層を用いて、発話間での感情ラベル遷移をモデリングし、予測ラベルの一貫性を強制する。
  • 最終的なモデルは、TSCTおよびPAGからの特徴を統合して、エンドツーエンドの感情分類を実現する。

実験結果

リサーチクエスチョン

  • RQ1統合モデルは、マルチターン会話において、自己話者および他話者コンテキスト依存関係を効果的に捉えることができるか?
  • RQ2グラフニューラルネットワークに相対的位置符号化を組み込むことで、ERCにおける時間的モデリングはどのように向上するか?
  • RQ3文脈特徴とラベル一貫性の統合モデリングが、感情認識パフォーマンスにどの程度向上効果をもたらすか?
  • RQ4提案されたアーキテクチャは、標準的なERCベンチマークにおいて、既存の最先端モデルと比較してどのように差をつけるか?

主な発見

  • S+PAGE は、IEMOCAPデータセットで重み付きF1スコア68.72を達成し、以前の最先端手法を上回っている。
  • MELDデータセットでは、重み付きF1スコア63.32を達成し、多様な会話スタイルにわたる強力な一般化能力を示している。
  • アブレーションスタディの結果、二重スレッド会話トランスフォーマーを削除すると、IEMOCAPで0.89ポイント、MELDで1.47ポイントのスコア低下が生じ、マルチスレーバー文脈におけるその重要性が確認された。
  • PAGモジュールを削除すると、IEMOCAPで4.58ポイント、MELDで2.25ポイントの顕著なスコア低下が生じ、話者依存性および時間的モデリングにおけるその役割が強調された。
  • CRF層の削除により、IEMOCAPで0.65ポイントのF1スコア低下が生じ、ラベル一貫性モデリングがパフォーマンス向上に寄与していることが示された。
  • モデルは、さまざまなウィンドウサイズにおいても安定したパフォーマンスを維持し、最小限の変動で長距離コンテキストの変動に耐性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。