[论文解读] Generating Persona-Consistent Dialogue Responses Using Deep Reinforcement Learning
本文提出了一种无参考的演员-评论家强化学习框架,用于训练基于Transformer的对话智能体,实现人格一致的回复生成。通过基于对话历史和人格事实定义一种新颖的奖励函数——衡量人格一致性、主题一致性和流畅性——在PERSONACHAT数据集上,经自动评估和人工评估验证,该方法在人格一致性方面显著优于监督基线模型。
Recent transformer-based open-domain dialogue agents are trained by reference responses in a fully supervised scenario. Such agents often display inconsistent personalities as training data potentially contain contradictory responses to identical input utterances and no persona-relevant criteria are used in their training losses. We propose a novel approach to train transformer-based dialogue agents using actor-critic reinforcement learning. We define a new reward function to assess generated responses in terms of persona consistency, topic consistency, and fluency. Our reference-agnostic reward relies only on a dialogue history and a persona defined by a list of facts. Automatic and human evaluations on the PERSONACHAT dataset show that our proposed approach increases the rate of persona-consistent responses compared with its peers that are trained in a fully supervised scenario using reference responses.
研究动机与目标
- 解决基于监督学习训练的基于Transformer的对话智能体在人格表达上不一致的问题。
- 通过开发一种无参考的训练框架,消除训练过程中对参考回复的依赖。
- 通过仅基于对话历史和人格事实的奖励函数,提升生成回复的人格一致性。
- 使用PERSONACHAT数据集上的自动指标和人工标注,评估所提方法的有效性。
提出的方法
- 采用演员-评论家强化学习框架,训练基于Transformer的对话策略。
- 设计一种新颖的奖励函数,仅基于对话历史和人格事实,评估回复的人格一致性、主题一致性和流畅性。
- 使用策略梯度方法端到端训练策略,优化所定义的奖励信号,无需参考回复。
- 将人格一致性定义为生成回复与给定人格事实之间的对齐程度,通过嵌入相似性或匹配机制计算。
- 通过测量对话历史中连续话语之间的连贯性,确保主题一致性。
- 通过将标准语言建模范式整合到奖励函数中,保持流畅性。
实验结果
研究问题
- RQ1与监督微调相比,无参考的强化学习方法是否能提升开放域对话系统中的人格一致性?
- RQ2仅基于对话历史和人格事实的奖励函数,在促进一致人格表达方面有多有效?
- RQ3在人格一致性的人工评估中,所提方法相较于监督基线模型的优越程度如何?
- RQ4该方法在提升人格一致性的同时,是否保持或改善了流畅性和主题一致性?
主要发现
- 所提强化学习方法在PERSONACHAT数据集上生成的人格一致回复比例高于监督基线模型。
- 人工评估确认,该模型生成的回复与给定人格的契合度高于基于参考的监督模型。
- 自动评估结果表明,该方法在不依赖参考回复的情况下,显著提升了人格一致性指标。
- 该方法在流畅性和主题一致性方面保持了强劲表现,表明回复质量未出现下降。
- 奖励函数有效引导策略生成既符合上下文又保持人格一致的回复。
- 该模型在多样化的人格配置上表现出良好的泛化能力,展示了在维持一致人格特征方面的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。