Skip to main content
QUICK REVIEW

[論文レビュー] Generating Emotionally Aligned Responses in Dialogues using Affect Control Theory

Nabiha Asghar, Ivan Kobyzev|arXiv (Cornell University)|Mar 7, 2020
Topic Modeling参考文献 55被引用数 8
ひとこと要約

本稿では、会話の感情的整合性を向上させるために、Affect Control Theory (ACT) をニューラル会話システムに統合する手法を提案する。発話をEPA(評価・能動性・活動性)ベクトルにマッピングし、ACTを用いて感情的に適切な応答を予測することで、感情的整合性の高い応答を生成する。本手法は、特に友人や敵対者といった感情的アイデンティティが明示的にモデル化されている場合に、ベースライン手法よりも感情的関連性が向上する。

ABSTRACT

State-of-the-art neural dialogue systems excel at syntactic and semantic modelling of language, but often have a hard time establishing emotional alignment with the human interactant during a conversation. In this work, we bring Affect Control Theory (ACT), a socio-mathematical model of emotions for human-human interactions, to the neural dialogue generation setting. ACT makes predictions about how humans respond to emotional stimuli in social situations. Due to this property, ACT and its derivative probabilistic models have been successfully deployed in several applications of Human-Computer Interaction, including empathetic tutoring systems, assistive healthcare devices and two-person social dilemma games. We investigate how ACT can be used to develop affect-aware neural conversational agents, which produce emotionally aligned responses to prompts and take into consideration the affective identities of the interactants.

研究の動機と目的

  • 最先端のニューラル会話システムにおいて感情的整合性に欠ける問題に対処する。特に、連続的な感情状態やユーザー固有の感情的アイデンティティを正しくモデル化できない点を改善すること。
  • 従来の感情会話モデルが離散的 emotion カテゴリに依存するという限界を克服する。ACTが提供する連続的で三次元の感情空間(EPA)を活用することで、より自然な感情表現を実現する。
  • 会話エージェントが入力発話と対話者同士の感情的アイデンティティに応じて、意味的に適切であるだけでなく感情的にも適切な応答を生成できることを実現する。
  • ニューラルシーケンスモデルとACTの社会的・数学的感情フレームワークとの間の表現ギャップを埋めるために、学習可能な S2EPA および EPA2S のコンponentsを導入する。
  • ACTを用いた応答生成が、標準的な seq2seq および CVAE ベースラインと比較して、感情的適切性および文脈的関連性の両面で向上するかどうかを評価する。

提案手法

  • S2EPA(文書からEPAに変換)および EPA2S(EPAから文書に変換)という2つの学習可能なコンponentsを備えたニューラルエンコーダ・デコーダパイプラインを提案する。
  • S2EPA モデルを用いて、入力発話をその感情的内容(評価、能動性、活動性)を表す3次元EPAベクトルにマッピングする。
  • 入力のEPAベクトルと発話者・応答者の感情的アイデンティティをACTに供給し、感情的対立を最小化する応答のEPAベクトルを予測する。
  • 予測された応答のEPAベクトルから自然言語の応答を生成するEPA2S モデルを用い、入力プロンプトと予測されたEPAベクトルの両方に条件付けられる。
  • 映画会話データセットを用いてS2EPAおよびEPA2Sモデルを学習し、友人同士・敵同士などのアイデンティティペアを用いて感情的応答生成を条件づける。
  • EPA2S コンponentには、seq2seq(Seq2Seq)および条件付き変動オートエンコーダ(CVAE)アーキテクチャを採用し、文脈と予測されたEPAベクトルの両方に条件付けられる。

実験結果

リサーチクエスチョン

  • RQ1Affect Control Theory (ACT) をニューラル会話生成に効果的に統合できるか?
  • RQ2友人と敵対者といった感情的アイデンティティをモデル化することで、生成された応答の感情的適切性はどのように向上するか?
  • RQ3S2EPA および EPA2S コンponentが、文脈的に関連性がありながらも感情的に適切な応答を生成する上で、どの程度貢献しているか?
  • RQ4ACTを補強したモデルの性能は、標準的なSeq2SeqおよびCVAEベースラインと比較して、感情的整合性および応答品質の面でどの程度優れているか?
  • RQ5自然言語発話とACTのEPA空間との間のマッピングにおける主な限界は何か? それらはモデル性能にどのように影響を及えるか?

主な発見

  • ACTを統合したモデルは、ベースラインのSeq2SeqおよびCVAEモデルと比較して、入力と対話者同士の感情的アイデンティティに応じた感情的整合性の高い応答を生成する。
  • 友人同士の状況では、CVAEとSeq2Seqモデルの両方が感情的整合性を向上させ、CVAEは6行中5行で感情的に適切な応答を生成した。一方、Seq2Seqは6行中4行で適切な応答を生成した。
  • 敵同士の状況では、ACTは非フレンドリーな行動(例:「怒鳴る」、「皮肉を言う」)を予測し、両モデルの応答が感情的文脈に適合する。特にCVAEは6行中5行で適切な応答を生成した。
  • S2EPA モデルは発話からEPAベクトルへのマッピングにおいてある程度の性能を示しているが、予測の不正確さが後続の応答生成に悪影響を及えることがある。
  • EPA2S モデルは、ACTのアイデンティティの選択に非常に敏感であり、特に同じ入力に対して多様な感情的応答をモデル化する場合、データ量が限られているため過学習のリスクを有する。
  • 本研究では、大規模かつアイデンティティに特化した文書-EPA リストの不足、およびEPAラベル付けの主観性が、モデル性能を制限する主な要因であると特定した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。