Skip to main content
QUICK REVIEW

[论文解读] Learning to Retrieve Entity-Aware Knowledge and Generate Responses with Copy Mechanism for Task-Oriented Dialogue Systems

Chao-Hong Tan, Xiaoyu Yang|arXiv (Cornell University)|Dec 22, 2020
Topic Modeling参考文献 30被引用 4
一句话总结

本论文提出了一种面向任务的对话系统,利用预训练语言模型(ELECTRA 和 RoBERTa)实现基于实体的知识检索与响应生成,并引入复制机制。在 DSTC9 Track 1 基准测试中,该系统在客观指标中位列第二,在人工评估中位列第四,通过潜在变量建模与后处理策略,显著提升了知识对齐效果与响应流畅性。

ABSTRACT

Task-oriented conversational modeling with unstructured knowledge access, as track 1 of the 9th Dialogue System Technology Challenges (DSTC 9), requests to build a system to generate response given dialogue history and knowledge access. This challenge can be separated into three subtasks, (1) knowledge-seeking turn detection, (2) knowledge selection, and (3) knowledge-grounded response generation. We use pre-trained language models, ELECTRA and RoBERTa, as our base encoder for different subtasks. For subtask 1 and 2, the coarse-grained information like domain and entity are used to enhance knowledge usage. For subtask 3, we use a latent variable to encode dialog history and selected knowledge better and generate responses combined with copy mechanism. Meanwhile, some useful post-processing strategies are performed on the model's final output to make further knowledge usage in the generation task. As shown in released evaluation results, our proposed system ranks second under objective metrics and ranks fourth under human metrics.

研究动机与目标

  • 为解决任务型对话系统中非结构化知识访问的挑战,传统 API 或数据库已不足以应对。
  • 通过从 FAQ 和评论等非结构化来源检索相关知识片段,提升响应生成质量。
  • 通过将领域和实体信息融入输入表示,提升模型在分布外及未见实体上的泛化能力。
  • 通过结合序列到序列建模与知识复制机制及潜在变量编码,生成更准确、更自然的响应。
  • 通过后处理策略优化模型输出,同时提升自动评估与人工评估得分。

提出的方法

  • 使用 ELECTRA 作为知识查询轮次检测的主干编码器,基于对话历史进行微调,并添加领域与实体标签。
  • 采用基于 RoBERTa 的检索与排序流水线,根据对话上下文从知识库中选择最相关知识片段。
  • 应用潜在变量模型联合编码对话历史与选定知识,以提升响应生成的上下文表征能力。
  • 在解码器中集成复制机制,允许直接将知识内容复制到响应中,提升事实一致性。
  • 采用两阶段解码策略(SRG 与 FFBS),结合束搜索,生成多样化且高质量的响应。
  • 应用后处理技术对模型输出进行优化,提升知识使用效率与人工评估得分。

实验结果

研究问题

  • RQ1预训练语言模型如 ELECTRA 和 RoBERTa 是否能有效检测任务型对话中的知识查询轮次?
  • RQ2在零样本或少样本设置下,引入领域与实体信息在多大程度上提升了知识选择性能?
  • RQ3潜在变量表征在多大程度上改善了对话历史、知识与生成响应之间的对齐?
  • RQ4复制机制在多大程度上有效保留了非结构化来源中的事实知识?
  • RQ5后处理策略是否能在不降低自动指标的前提下提升响应质量?

主要发现

  • 所提系统在 DSTC9 Track 1 测试集上,客观指标位列第二,人工评估位列第四。
  • 基于知识感知的 ELECTRA 模型在知识查询轮次检测任务上,F1 分数相比原始 ELECTRA 提升 2.6%。
  • 知识复制机制相比基线生成模型,BLEU-4 提升 0.5%,METEOR 提升 1.6%,ROUGE-L 提升 1.2%。
  • 后处理策略提升了人工评估中响应的恰当性与准确性得分,尽管对自动指标造成轻微下降。
  • 数据增强显著提升了 recall@1,尤其在领域与实体预测方面,表明对分布外样本具有更好的泛化能力。
  • 集成模型在知识选择任务上显著优于基线,mrr@5 与 recall@5 均取得显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。