Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-Enriched Transformer for Emotion Detection in Textual Conversations

Peixiang Zhong, Di Wang|arXiv (Cornell University)|Sep 24, 2019
Sentiment Analysis and Opinion Mining参考文献 64被引用数 9
ひとこと要約

本稿では、コンセプトネットとNRC_VADから得られる外部の一般常識知識を動的に統合することで、会話文の感情検出のための知識拡張トランスフォーマー(KET)を提案する。KETは文脈モデリングに階層的自己注意機構を、外部知識統合に文脈に適応した感情的グラフ注意機構を採用し、複数のデータセットで最先端の性能を達成した。特に、従来モデルに比べて顕著なF1スコアの向上を示し、文脈と一般常識知識を統合的に活用する有効性を実証した。

ABSTRACT

Messages in human conversations inherently convey emotions. The task of detecting emotions in textual conversations leads to a wide range of applications such as opinion mining in social networks. However, enabling machines to analyze emotions in conversations is challenging, partly because humans often rely on the context and commonsense knowledge to express emotions. In this paper, we address these challenges by proposing a Knowledge-Enriched Transformer (KET), where contextual utterances are interpreted using hierarchical self-attention and external commonsense knowledge is dynamically leveraged using a context-aware affective graph attention mechanism. Experiments on multiple textual conversation datasets demonstrate that both context and commonsense knowledge are consistently beneficial to the emotion detection performance. In addition, the experimental results show that our KET model outperforms the state-of-the-art models on most of the tested datasets in F1 score.

研究の動機と目的

  • 会話文における感情検出の課題に取り組む。ここでは、文脈と一般常識知識が重要であるが、従来のモデルではしばしば無視されがちである。
  • 外部知識ベースから得られる階層的文脈モデリングと動的で文脈に適応し、感情的に関連する知識を統合することで、感情検出の性能を向上させる。
  • 特に、曖昧な感情表現や内省的な感情表現において、文脈情報と一般常識知識の両方が感情検出に与える影響を調査する。
  • 多様な会話的ドメインに一般化可能であり、低リソースまたは多言語環境にも適応可能なモデルを開発する。

提案手法

  • KETは、会話文の文脈と応答をエンコーダーとデコーダーのブランチに分離する階層的自己注意機構を採用し、会話構造の効率的モデリングを可能にする。
  • クロスアテンションを用いて発話間の依存関係を捉え、デコーダーがエンコーダーからの関連する文脈に注目できるようにする。
  • 外部の一般常識知識はコンセプトネットから取得され、エンティティ埋め込みを介して語にリンクされ、文脈に適応した感情的グラフ注意機構によって関連性が重み付けされる。
  • 注意機構は、学習可能なパラメータλkを用いて、取得した知識の類似性と感情的関連性のバランスを動的に調整し、感情的関連性に基づいた知識の統合を最適化する。
  • 知識エンティティはNRC_VADを用いて感情的価値(感情の正負、覚醒度、優位性)で拡張され、注意機構が感情的に顕著な知識に注目するように導く。
  • マルチクラス感情分類の交差エントロピー損失を用いて、エンド・トゥ・エンドでモデルを訓練し、文脈と知識のコンポonentの寄与を検証するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1RNNやCNNベースのモデルと比較して、階層的自己注意機構を統合することで、会話文における感情検出性能がどのように向上するか?
  • RQ2外部知識ベースから動的に一般常識知識を統合することで、感情検出性能がどの程度向上するか?
  • RQ3感情検出の文脈において、注意機構における知識の類似性と感情的関連性の最適なトレードオフは何か?
  • RQ4感情の複雑さやデータサイズが異なる多様な会話データセットにおいて、モデルの性能はどの程度か?
  • RQ5多言語知識ベースと感情語彙を用いることで、低リソースまたは多言語環境にも一般化可能か?

主な発見

  • KETは、EC(0.7451)、DailyDialog(0.5544)、MELD(0.5401)、EmoryNLP(0.3712)、IEMOCAP(0.5389)の全テストデータセットで最先端のF1スコアを達成し、従来モデルを上回った。
  • アブレーションスタディの結果、文脈または知識の両方を削除すると性能が著しく低下し、特に長文の会話では文脈の影響がより顕著であった。
  • 感情的グラフ注意機構における最適なλk値は0.3〜0.7の間であり、λk=0.7が大多数のデータセットで最高の性能を示した。
  • コンセプトネットのサイズが大きくなるにつれて性能が向上し、ある閾値を超えると頭打つようになることから、広範な一般常識知識の価値が裏付けられた。
  • 特に嫌悪と恐怖の検出に苦戦を強いられ、MELDでは恐怖のF1スコアが0.0667まで低下した。これは、両者の感情が低正負(valence)と高覚醒度(arousal)で類似しており、トレーニングデータが限られていることが要因である。
  • モデルはドメインにかかわらず頑健であり、多言語知識ベースと感情語彙を用いることで他の言語にも適応可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。