Skip to main content
QUICK REVIEW

[论文解读] Personalized Query Rewriting in Conversational AI Agents

Alireza Roshan Ghias, Clint Solomon Mathialagan|arXiv (Cornell University)|Nov 9, 2020
Topic Modeling参考文献 18被引用 5
一句话总结

本文提出了一种个性化查询重写框架,用于对话式AI代理,通过利用用户特定的交互记忆来纠正自动语音识别(ASR)和自然语言理解(NLU)中的错误。采用带有层次注意力机制和神经检索的指针-生成网络,该模型在结合ASR的n-best输出和用户历史记录时,显著提升了重写准确率和意图恢复能力,优于基线模型。

ABSTRACT

Spoken language understanding (SLU) systems in conversational AI agents often experience errors in the form of misrecognitions by automatic speech recognition (ASR) or semantic gaps in natural language understanding (NLU). These errors easily translate to user frustrations, particularly so in recurrent events e.g. regularly toggling an appliance, calling a frequent contact, etc. In this work, we propose a query rewriting approach by leveraging users' historically successful interactions as a form of memory. We present a neural retrieval model and a pointer-generator network with hierarchical attention and show that they perform significantly better at the query rewriting task with the aforementioned user memories than without. We also highlight how our approach with the proposed models leverages the structural and semantic diversity in ASR's output towards recovering users' intents.

研究动机与目标

  • 减少对话式AI代理在重复交互中因ASR和NLU错误而引起的用户挫败感。
  • 通过利用用户以往成功的交互作为个性化记忆,提升查询重写的性能。
  • 比较基于检索和生成式(指针-生成)神经模型在ASR不确定性下的查询重写效果。
  • 研究ASR n-best输出与用户记忆如何协同提升意图恢复和重写质量。
  • 开发一种可扩展的端到端框架,集成用户记忆和ASR不确定性,且无需额外的下游开销。

提出的方法

  • 一种神经检索模型使用双向LSTM对ASR的n-best假设和用户记忆中的语句进行编码,然后通过记忆对ASR输出应用注意力机制,生成上下文感知的表征。
  • 一种带有层次注意力机制的指针-生成网络首先关注ASR的n-best输出,再关注用户记忆,使模型能够从任一来源复制或生成重写部分。
  • 指针网络使用覆盖机制以防止重复复制,并通过组合ASR n-best和记忆中的组件来生成新语句,从而提升泛化能力。
  • 模型在包含约100万条匿名重述对的大型数据集上进行训练,其中第一条语句为ASR失败的输出,第二条为成功的重述。
  • ASR n-best输出被用作输入以引入不确定性,模型被训练为将原始ASR假设重写为与成功重述匹配的形式。
  • 该框架设计为可扩展,支持对话上下文,并可未来与ASR图谱集成,以支持更丰富的假设空间。

实验结果

研究问题

  • RQ1用户特定的交互记忆是否能显著提升对话式AI系统中的查询重写性能?
  • RQ2引入ASR n-best输出如何影响查询重写模型的鲁棒性和准确性?
  • RQ3在个性化查询重写中,生成式指针网络方法是否优于基于检索的基线模型?
  • RQ4当ASR输出在语义或发音上不正确时,模型在多大程度上能恢复正确的意图?
  • RQ5当用户在多轮对话中改变意图时,模型如何应对?这对评估有何影响?

主要发现

  • 带有层次注意力机制的指针-生成网络在保持90%精确率的同时,召回率高于检索模型,表明其具有更好的泛化能力和意图恢复能力。
  • 与检索模型相比,指针网络发生意图错误的可能性低五倍,证明其在理解语义意图方面表现更优。
  • 即使记忆中不存在完全匹配的重述,模型也能成功重写部分错误,例如将'launch room'更正为'laundry room',通过组合ASR n-best和记忆中的组件生成新语句。
  • 引入ASR n-best输出提升了两种模型的性能,因为它为学习正确重写提供了额外信号。
  • 检索模型受限于在记忆中匹配完全或相似的短语,而指针网络能够通过从多个来源复制来生成新颖且正确的重写。
  • 通过同时利用用户记忆和ASR不确定性,该框架在查询重写任务上达到了最先进性能,且未增加下游计算成本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。