Skip to main content
QUICK REVIEW

[論文レビュー] Emotional Neural Language Generation Grounded in Situational Contexts

Sashank Santhanam, Samira Shaikh|arXiv (Cornell University)|Nov 25, 2019
Topic Modeling参考文献 32被引用数 7
ひとこと要約

本稿では、状況的感情ラベルで条件付けられた微調整されたGPT-2言語モデルを提案し、会話型AIにおける感情に適した応答を生成する。Empathetic-Dialoguesデータセットで微調整することで、先行する最先端手法と比較して5ポイント低い perplexity とより高い BLEU スコアを達成し、トランスファー学習によって感情の関連性と応答品質が向上することを示している。

ABSTRACT

Emotional language generation is one of the keys to human-like artificial intelligence. Humans use different type of emotions depending on the situation of the conversation. Emotions also play an important role in mediating the engagement level with conversational partners. However, current conversational agents do not effectively account for emotional content in the language generation process. To address this problem, we develop a language modeling approach that generates affective content when the dialogue is situated in a given context. We use the recently released Empathetic-Dialogues corpus to build our models. Through detailed experiments, we find that our approach outperforms the state-of-the-art method on the perplexity metric by about 5 points and achieves a higher BLEU metric score.

研究の動機と目的

  • 文脈と感情に基づいて応答を生成することで、ニューラル会話応答生成における感情の関連性を向上させること。
  • seq2seqベースの会話エージェントにおける一般的で退屈な応答の限界を解消すること。
  • 事前学習された言語モデルを感情条件付き会話データで微調整することで、応答品質が向上するかどうかを調査すること。
  • 同じデータセット上で、微調整とプロンプトベースの条件付け(例:感情の前置き)を比較し、感情的応答生成における性能を検証すること。

提案手法

  • 117Mパラメータの事前学習済みGPT-2モデルを、トランスファー学習を用いてEmpathetic-Dialoguesデータセットで微調整する。
  • 特別なトークンを用いて感情ラベルを入力シーケンスの先頭に追加することで、言語モデルを感情ラベルで条件づける。
  • 繰り返しや多様性の欠如が見られるビームサーチを避けるために、nucleusサンプリング(p=0.9)をデコードに使用する。
  • PyTorch TransformersとBPEトークン化を用い、1台のTitan V GPUで約2時間トレーニングする。
  • 自動評価指標(BLEU、perplexity)と人間評価(読みやすさ、一貫性、感情の適切さ)を用いて性能を評価する。
  • 微調整モデルと感情前置きモデルの2つのバリアントを比較し、性能に与える影響をアブレーション解析する。

実験結果

リサーチクエスチョン

  • RQ1事前学習された言語モデルを感情に基づく会話データで微調整することで、ベースラインのseq2seqモデルと比較して応答品質が向上するか?
  • RQ2同じデータセット上で、感情の前置きによる条件づけが、エンドツーエンドの微調整よりも優れた結果をもたらすか?
  • RQ3BLEU や perplexity といった自動評価指標は、感情の適切さや一貫性に関する人間の評価とどの程度相関するか?
  • RQ4大規模な事前学習モデルからのトランスファー学習は、より小さな感情特化型会話データセットにおいて、どの程度性能を向上させるか?
  • RQ5なぜ微調整が単純な感情の前置きよりも、感情に適した応答を生成する際に優れているのか?

主な発見

  • 微調整モデルは、最先端手法と比較して検証セットで5ポイント低い perplexity を達成しており、言語モデルとしての性能が向上していることを示している。
  • 微調整モデルは現在の最先端手法よりも高い BLEU スコアを達成しており、生成品質の向上が裏付けられている。
  • 人間評価では、微調整モデルが全指標で感情前置きモデルを上回っている:読みやすさ(4.14 対 3.54)、一貫性(3.50 対 3.40)、感情の適切さ(3.70 対 3.19)。
  • 正解応答は感情の適切さで最高の評価(4.00)を獲得しており、微調整モデルが感情前置きバージョンよりも人間水準に近い性能を示していることが示された。
  • 構造が単純であるにもかかわらず、感情前置きモデルは微調整モデルに劣っているため、微調整が文脈と感情の依存関係をより良く捉えていると考えられる。
  • 今後の研究では、生成パイプラインに感情分類を統合することで、生成された応答の感情的内容を検証する必要があると同定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。