[论文解读] Improving Multi-turn Dialogue Modelling with Utterance ReWriter
本文提出了一种基于Transformer的话语重写模型,通过解决多轮对话中的指代消解和省略信息补全问题,提升多轮对话系统的性能。通过重写话语以恢复上下文依赖关系,该模型增强了下游意图检测与响应生成能力,在线上聊天机器人中实现了0.86的F1分数并提升了用户参与度。
Recent research has made impressive progress in single-turn dialogue modelling. In the multi-turn setting, however, current models are still far from satisfactory. One major challenge is the frequently occurred coreference and information omission in our daily conversation, making it hard for machines to understand the real intention. In this paper, we propose rewriting the human utterance as a pre-process to help multi-turn dialgoue modelling. Each utterance is first rewritten to recover all coreferred and omitted information. The next processing steps are then performed based on the rewritten utterance. To properly train the utterance rewriter, we collect a new dataset with human annotations and introduce a Transformer-based utterance rewriting architecture using the pointer network. We show the proposed architecture achieves remarkably good performance on the utterance rewriting task. The trained utterance rewriter can be easily integrated into online chatbots and brings general improvement over different domains.
研究动机与目标
- 为解决多轮对话中指代消解与信息省略带来的挑战,这些挑战会阻碍准确理解与响应生成。
- 开发一种与模型无关、内存高效的预处理步骤,将多轮对话简化为单轮问题。
- 收集并发布一个高质量、人工标注的中文对话数据集,用于指代消解与信息补全任务。
- 通过集成话语重写模型,提升真实世界聊天机器人系统中的意图检测与响应质量。
提出的方法
- 话语重写模型采用改进的Transformer架构,通过引入指针网络机制,以抽取式生成任务的方式进行训练。
- 模型通过基于注意力的机制,从当前话语或对话历史中复制词语,生成重写后的话语。
- 该架构结合了Transformer的自注意力机制以建模句内依赖关系,同时保留从源文本中复制的能力。
- 收集了一个包含20,000个多轮中文对话的全新数据集,包含人工标注的重写结果,用于监督训练。
- 使用一种平衡指代消解与信息补全目标的损失函数进行微调,采用加权λ损失以平衡两个目标。
- 将训练好的重写模型集成到两个在线聊天机器人平台中:一个任务导向系统与一个闲聊系统,用于端到端评估。
实验结果
研究问题
- RQ1预处理阶段的话语重写模型是否能通过解决指代消解与信息补全问题,显著提升多轮对话理解能力?
- RQ2与RNN和标准Transformer基线模型相比,基于Transformer的指针网络架构在话语重写任务中的有效性如何?
- RQ3在任务导向对话系统中,集成话语重写模型对意图分类准确率的提升程度如何?
- RQ4在真实世界聊天机器人应用中,话语重写模型是否带来可测量的用户参与度与对话质量提升?
主要发现
- 所提出的T-Ptr-λ模型在话语重写任务上取得了0.86的F1分数,优于RNN与标准Transformer基线模型。
- 在任务导向聊天机器人中,话语重写模型将意图分类精确率从81.0%提升至89.91%,相对提升超过9%。
- 在线A/B测试显示,集成重写模型后,每会话平均对话轮次(CPS)从6.3提升至7.7,表明用户参与度提高。
- 人工评估显示,模型生成的重写结果流畅自然,流畅度得分为4.90(满分5.0),接近人类参考结果(4.97)。
- 重写模型成功恢复了隐含信息,例如在与天气相关的查询中恢复出'under the weather in Beijing',从而实现正确意图检测。
- 该模型具备良好的跨领域泛化能力,可轻松集成至现有黑箱对话系统中,无需修改架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。