Skip to main content
QUICK REVIEW

[論文レビュー] DialogXL: All-in-One XLNet for Multi-Party Conversation Emotion Recognition

Weizhou Shen, Junqing Chen|arXiv (Cornell University)|Dec 16, 2020
Sentiment Analysis and Opinion Mining参考文献 24被引用数 17
ひとこと要約

本稿では、マルチパーティ会話感情認識のための最初の包括的XLNetベースのモデルであるDialogXLを紹介する。XLNetに発話レベルの再帰と会話に配慮した自己注意機構を組み込み、発話者内および発話者間の依存関係を捉える。階層的アーキテクチャを用いず、長距離の文脈と発話者役割を効果的にモデル化することで、4つのERCベンチマークで最先端の性能を達成した。

ABSTRACT

This paper presents our pioneering effort for emotion recognition in conversation (ERC) with pre-trained language models. Unlike regular documents, conversational utterances appear alternately from different parties and are usually organized as hierarchical structures in previous work. Such structures are not conducive to the application of pre-trained language models such as XLNet. To address this issue, we propose an all-in-one XLNet model, namely DialogXL, with enhanced memory to store longer historical context and dialog-aware self-attention to deal with the multi-party structures. Specifically, we first modify the recurrence mechanism of XLNet from segment-level to utterance-level in order to better model the conversational data. Second, we introduce dialog-aware self-attention in replacement of the vanilla self-attention in XLNet to capture useful intra- and inter-speaker dependencies. Extensive experiments are conducted on four ERC benchmarks with mainstream models presented for comparison. The experimental results show that the proposed model outperforms the baselines on all the datasets. Several other experiments such as ablation study and error analysis are also conducted and the results confirm the role of the critical modules of DialogXL.

研究の動機と目的

  • 事前学習済み言語モデル(例:XLNet)がマルチパーティ・マルチターン会話の感情認識において、どのような制限を抱えているかを解決すること。
  • 長距離および発話者依存の依存関係を捉えるために、セグメントレベルの再帰と汎用的自己注意機構の制限を克服すること。
  • 階層的アーキテクチャを用いない統一的で非階層的なフレームワークを設計し、事前学習モデルを会話感情認識に直接適用すること。
  • 広範なアブレーションおよび誤差分析を通じて、発話者レベルの再帰と会話に配慮した自己注意機構の有効性を検証すること。

提案手法

  • XLNetのセグメントレベルの再帰を発話者レベルの再帰に置き換え、履歴発話の隠れ状態をメモリバンクに保存・再利用することで、より長い文脈モデリングを可能にする。
  • 会話に配慮した自己注意機構を導入し、局所的・グローバル的・発話者・リスナーの4種類の自己注意を計算することで、発話者内および発話者間の依存関係をモデル化する。
  • 履歴発話表現の保存におけるパディングのオーバーヘッドを低減し、効率を向上させるためにメモリ機構を強化する。
  • 複雑な階層的モデリングを回避するため、会話全体を1つの入力シーケンスとして処理する統一アーキテクチャを設計する。
  • 外部埋め込みに依存せず、発話者役割の認識を注意計算そのものに直接統合する。
  • エンドツーエンドの微調整を用いて、4つの公開ERCベンチマークにモデルを適用し、感情分類を実行する。

実験結果

リサーチクエスチョン

  • RQ1階層的モデリングを用いずに、XLNetのような事前学習言語モデルがマルチパーティ会話感情認識に効果的に適応可能か?
  • RQ2発話者レベルの再帰は、セグメントレベルの再帰に比べて、長距離の会話的文脈をどれほど効果的に保持できるか?
  • RQ3会話に配慮した自己注意機構は、発話者内および発話者間の依存関係をモデル化することで、どれほど性能を向上させるか?
  • RQ4DialogXLの個々の構成要素(例:発話者注意 vs. リスナー注意)は、全体の性能にどのように寄与しているか?
  • RQ5モデルの失敗モードは何か?また、注意機構だけでは会話における感情的文脈を信頼性高く捉えられるか?

主な発見

  • DialogXLは4つのERCベンチマークすべてでベースラインを上回り、IEMOCAPではF1スコア65.94、DailyDialogでは54.93という最先端の結果を達成した。
  • アブレーションスタディの結果、会話に配慮した自己注意機構の任意の構成要素を削除すると性能が著しく低下し、特にリスナー自己注意が最大の低下(IEMOCAPで↓3.07 F1)を引き起こした。
  • 発話者レベルの再帰機構により、セグメントレベルの再帰に比べてメモリパディングを60%以上削減し、効率性と文脈保持の両方を向上させた。
  • 会話に配慮した自己注意機構は、発話者役割埋め込みよりもIEMOCAPで2.63 F1ポイント優れており、発話者ダイナミクスのモデル化において優位性を示した。
  • 誤差分析の結果、モデルはクエリと履歴発話の意味的類似性に過剰に依存しており、感情のシフトが生じる45%のケースで誤分類を起こす傾向にあった。
  • 感情的文脈のシフトが生じた場合、モデルが注意機構にのみ依存することは誤解を招く可能性があるため、今後の研究では補完的メカニズムの導入が不可欠であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。