Skip to main content
QUICK REVIEW

[论文解读] Generate, Delete and Rewrite: A Three-Stage Framework for Improving Persona Consistency of Dialogue Generation

Haoyu Song, Yan Wang|arXiv (Cornell University)|Apr 16, 2020
Topic Modeling参考文献 41被引用 14
一句话总结

本文提出了一种三阶段的生成-删除-重写(GDR)框架,通过先生成响应,再利用一致性匹配模型识别并遮蔽不一致的与人格相关的词语,最后重写遮蔽后的响应以增强人格一致性,从而提升对话生成中的人格一致性。该方法在Persona-Chat数据集上实现了最先进性能,显著提升了人格一致性,同时未牺牲响应质量。

ABSTRACT

Maintaining a consistent personality in conversations is quite natural for human beings, but is still a non-trivial task for machines. The persona-based dialogue generation task is thus introduced to tackle the personality-inconsistent problem by incorporating explicit persona text into dialogue generation models. Despite the success of existing persona-based models on generating human-like responses, their one-stage decoding framework can hardly avoid the generation of inconsistent persona words. In this work, we introduce a three-stage framework that employs a generate-delete-rewrite mechanism to delete inconsistent words from a generated response prototype and further rewrite it to a personality-consistent one. We carry out evaluations by both human and automatic metrics. Experiments on the Persona-Chat dataset show that our approach achieves good performance.

研究动机与目标

  • 为解决神经对话模型中持续存在的个性不一致问题,即尽管使用了人格编码架构,模型仍会生成与用户提供的个性描述相矛盾的响应。
  • 克服单阶段解码框架的局限性,即使在高概率响应中出现不一致的人格词语,也无法显式纠正。
  • 开发一种结构化、端到端的框架,整合不一致人格词语的检测与优化,以增强响应的一致性。
  • 通过自动指标和Persona-Chat数据集上的人工评估,检验该框架的有效性。

提出的方法

  • 基于Transformer的生成器基于输入对话和人格嵌入生成初始响应原型。
  • 一致性匹配模型(D)评估生成响应中每个词语与人格文本的一致性,并分配得分以检测不一致的词语。
  • 根据匹配得分,将不一致的词语从响应原型中遮蔽(删除),形成部分遮蔽的序列。
  • 重写模型随后重建遮蔽后的响应,通过条件生成恢复连贯性,并确保人格一致性。
  • 整个框架端到端训练,删除和重写阶段联合优化以提升人格对齐效果。
  • 一致性匹配模型通过DNLI风格的自然语言蕴含任务进行训练,以分类响应词语是否与人格一致。

实验结果

研究问题

  • RQ1能否通过将生成、不一致性检测与优化分离的三阶段框架,提升对话系统中的人格一致性?
  • RQ2一致性匹配模型在多大程度上能够检测并遮蔽生成响应中不一致的人格词语?
  • RQ3对遮蔽后的响应进行重写,是否能在不降低响应相关性或流畅性的情况下提升人格一致性?
  • RQ4与现有单阶段基于人格的模型相比,GDR框架在一致性与响应质量方面表现如何?

主要发现

  • GDR框架在Persona-Chat数据集上实现了最先进性能,在自动评估与人工评估指标上均优于竞争性基线模型。
  • 人工评估显示人格一致性显著提升,GDR模型生成的响应与提供的个性描述更加一致。
  • 自动指标如困惑度显著下降,表明模型与真实响应对齐更好,序列重建性能更优。
  • 消融实验确认,删除与重写阶段均对响应质量有积极贡献,其中删除阶段在识别不一致词语方面尤为关键。
  • 当初始响应中包含不一致词语(如人格为“牙医”时出现“护士”)时,该框架能成功将其遮蔽并重写为与人格一致的替代词。
  • 框架保持了较强的响应相关性与流畅性,各模型的相关性得分稳定,表明一致性提升并未以牺牲响应连贯性为代价。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。