Skip to main content
QUICK REVIEW

[论文解读] A dataset for resolving referring expressions in spoken dialogue via contextual query rewrites (CQR)

Michael Regan, Pushpendre Rastogi|arXiv (Cornell University)|Mar 28, 2019
Natural Language Processing Techniques参考文献 20被引用 4
一句话总结

本文提出了上下文查询重写(CQR),一种新颖的方法,通过利用对话上下文将多轮口语对话中模糊的用户语句重写为无歧义的单轮自然语言查询,从而解决指代表达问题。该方法在新发布的公开数据集上实现了更高的槽位填充准确率(F1: 0.91 vs. 0.89),表明查询重写可简化下游NLU任务并提升性能,且无需显式状态追踪或领域特定的NLU更新。

ABSTRACT

We present Contextual Query Rewrite (CQR) a dataset for multi-domain task-oriented spoken dialogue systems that is an extension of the Stanford dialog corpus (Eric et al., 2017a). While previous approaches have addressed the issue of diverse schemas by learning candidate transformations (Naik et al., 2018), we instead model the reference resolution task as a user query reformulation task, where the dialog state is serialized into a natural language query that can be executed by the downstream spoken language understanding system. In this paper, we describe our methodology for creating the query reformulation extension to the dialog corpus, and present an initial set of experiments to establish a baseline for the CQR task. We have released the corpus to the public [1] to support further research in this area.

研究动机与目标

  • 为解决多轮任务导向对话中指代表达的挑战,特别是零回指等隐式引用问题。
  • 通过将指代解析问题转化为查询重写任务,消除对显式状态追踪器和领域特定NLU更新的需求。
  • 提出一种可扩展的、与模式无关的方法,以提升对话系统中的口语理解能力。
  • 发布一个公开可用的数据集,包含人工标注的黄金标准与众包生成的查询重写结果,以支持未来研究。

提出的方法

  • CQR任务通过整合先前对话轮次中的相关槽位值,将模糊的用户语句重写为无歧义的、上下文丰富的单轮查询。
  • 该方法利用对话历史,将相关槽位值(如位置、实体名称)传递至自然语言查询中,以解决隐式引用问题。
  • 数据集通过在斯坦福对话语料库基础上,使用Amazon Mechanical Turk扩展人工标注的黄金标准与众包生成的查询重写结果构建而成。
  • 基于OpenNMT的序列到序列模型被训练以生成重写后的查询,其超参数经过调优以提升准确率。
  • 该方法在两个任务上进行评估:领域分类与槽位填充,比较原始对话与重写后查询的性能表现。
  • 训练过程中应用去标识化处理,以保留泛化能力,即将具体实体替换为规范类型(如poi_type)。

实验结果

研究问题

  • RQ1在无需显式状态追踪的情况下,上下文查询重写能否有效解决多轮口语对话中的指代表达问题?
  • RQ2将用户语句重写为无歧义的单轮查询,是否能提升下游NLU任务(如领域分类与槽位填充)的性能?
  • RQ3使用原始对话与CQR重写查询时,NLU系统的性能表现有何差异?
  • RQ4众包生成的查询重写结果在多大程度上具有泛化能力?其在词汇多样性与模型准确率方面与黄金标准重写结果相比如何?

主要发现

  • CQR方法在黄金标准重写结果上的槽位填充F1得分为0.91,显著高于原始对话的F1得分0.89。
  • 无论是原始输入还是重写输入,领域分类准确率均保持在0.98的高水平,表明重写过程有效保留了意图理解能力。
  • 仅使用黄金标准重写数据训练的模型在开发集上达到F1得分0.838与BLEU得分0.711,表明其在核心任务上表现优异。
  • 当同时使用黄金标准与众包生成的重写数据进行训练时,模型达到F1得分0.897与BLEU得分0.397,表明尽管众包结果错误率较高,但多样化的人工重写有助于提升泛化能力。
  • 该任务具有相当复杂性,因为67%的槽位值从对话历史中传递至重写结果,表明捕捉上下文相关信息具有显著挑战。
  • 结果表明,通过将多轮模糊表达转化为单轮清晰查询,查询重写可简化NLU任务,使模型在极少架构改动下实现更高准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。