Skip to main content
QUICK REVIEW

[论文解读] Emotional Neural Language Generation Grounded in Situational Contexts

Sashank Santhanam, Samira Shaikh|arXiv (Cornell University)|Nov 25, 2019
Topic Modeling参考文献 32被引用 7
一句话总结

本文提出了一种基于情境情绪标签微调的 GPT-2 语言模型,用于在对话式人工智能中生成情感恰当的回复。通过在 Empathetic-Dialogues 数据集上进行微调,该模型相较于先前的最先进方法,困惑度降低了 5 分,BLEU 分数更高,表明通过迁移学习实现了更优的情感相关性和回复质量。

ABSTRACT

Emotional language generation is one of the keys to human-like artificial intelligence. Humans use different type of emotions depending on the situation of the conversation. Emotions also play an important role in mediating the engagement level with conversational partners. However, current conversational agents do not effectively account for emotional content in the language generation process. To address this problem, we develop a language modeling approach that generates affective content when the dialogue is situated in a given context. We use the recently released Empathetic-Dialogues corpus to build our models. Through detailed experiments, we find that our approach outperforms the state-of-the-art method on the perplexity metric by about 5 points and achieves a higher BLEU metric score.

研究动机与目标

  • 通过将回复建立在情境上下文和情感基础上,提升神经对话回复生成中的情感相关性。
  • 解决基于 seq2seq 的对话智能体产生的通用化、平淡化回复的局限性。
  • 探究在情感条件化对话数据上微调预训练语言模型是否能提升回复质量。
  • 比较微调与基于提示的条件化方法(如情感前缀添加)在情感回复生成中的表现。

提出的方法

  • 使用迁移学习在 Empathetic-Dialogues 数据集上微调一个预训练的 GPT-2 模型(117M 参数)。
  • 通过在输入序列前添加带有特殊标记的情感标签,对语言模型进行情感标签条件化,以引导回复生成。
  • 采用核采样(p=0.9)进行解码,以避免束搜索中常见的重复性和多样性不足问题。
  • 使用 PyTorch Transformers 和 BPE 分词,在单张 Titan V GPU 上训练模型约 2 小时。
  • 通过自动指标(BLEU、困惑度)和人工评估(可读性、连贯性、情感恰当性)评估性能。
  • 对比两种模型变体:微调模型与情感前缀添加模型,并进行消融实验。

实验结果

研究问题

  • RQ1与基线 seq2seq 模型相比,在情感驱动对话数据上微调预训练语言模型是否能提升回复质量?
  • RQ2在相同数据集上,通过情感前缀添加条件化是否优于端到端微调?
  • RQ3自动指标(如困惑度和 BLEU)与人类对情感恰当性和连贯性的判断之间是否存在相关性?
  • RQ4从大规模预训练模型进行迁移学习,在较小规模、情感特定的对话数据集上能在多大程度上提升性能?
  • RQ5为何微调在生成情感恰当回复方面优于简单的感情前缀添加?

主要发现

  • 与最先进方法相比,微调模型在验证集上的困惑度降低了 5 分,表明语言建模性能更优。
  • 微调模型的 BLEU 分数高于当前最先进方法,表明生成质量更优。
  • 人工评估显示,微调模型在所有指标上均优于情感前缀添加模型:可读性(4.14 vs. 3.54)、连贯性(3.50 vs. 3.40)和情感恰当性(3.70 vs. 3.19)。
  • 真实回复获得最高的人工评分(情感恰当性得分为 4.00),表明微调模型的性能更接近人类水平,优于情感前缀添加变体。
  • 尽管结构更简单,情感前缀添加模型仍表现逊于微调模型,表明微调能更好地捕捉上下文与情感之间的依赖关系。
  • 本研究指出,未来工作需探索将情感分类集成到生成流程中,以验证生成回复的情感内容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。