Skip to main content
QUICK REVIEW

[论文解读] Predicting Causes of Reformulation in Intelligent Assistants

Shumpei Sano, Nobuhiro Kaji|arXiv (Cornell University)|Jul 13, 2017
AI in Service Interactions参考文献 17被引用 4
一句话总结

本文提出一种方法,用于预测智能助手(IAs)中用户改写请求的成因,采用针对ASR、NLU和LG组件定制的特征。在真实商业IA日志上进行评估,该模型优于仅使用会话和改写相关特征的基线模型,表明组件特定特征显著提升了对NLU和LG错误成因的检测能力,尤其在这些错误类型上表现突出。

ABSTRACT

Intelligent assistants (IAs) such as Siri and Cortana conversationally interact with users and execute a wide range of actions (e.g., searching the Web, setting alarms, and chatting). IAs can support these actions through the combination of various components such as automatic speech recognition, natural language understanding, and language generation. However, the complexity of these components hinders developers from determining which component causes an error. To remove this hindrance, we focus on reformulation, which is a useful signal of user dissatisfaction, and propose a method to predict the reformulation causes. We evaluate the method using the user logs of a commercial IA. The experimental results have demonstrated that features designed to detect the error of a specific component improve the performance of reformulation cause detection.

研究动机与目标

  • 自动化智能助手中的错误成因检测,以解决当前在复杂多组件系统中依赖人工日志分析所导致的瓶颈问题。
  • 识别并分类导致用户改写请求的根本组件(ASR、NLU、LG或无错误),作为用户不满的信号。
  • 基于商业智能助手的真实用户日志,构建预测模型,以缩短系统性能优化的迭代周期。
  • 创建一个经人工标注的改写成因数据集,供未来智能助手错误诊断研究使用。

提出的方法

  • 将改写成因预测建模为四分类问题:无错误、ASR错误、NLU错误或LG错误。
  • 根据特征与IA组件的相关性对特征进行分类,包括ASR置信度、意图类型、输入模态(语音/文本)、对话行为(dialog acts)以及输入类型切换(如Voice2Text、Text2Voice)等。
  • 使用线性核SVM对组合特征集进行训练,并分析特征权重以评估其对各类错误的贡献度。
  • 基于商业IA的真实用户日志对模型进行评估,并与仅使用会话和改写相关特征的基线模型进行对比。
  • 采用交叉验证计算中位数特征权重,以解释各类错误类型预测中最具影响力的特征。

实验结果

研究问题

  • RQ1在智能助手中,哪些组件最常导致用户改写请求?
  • RQ2与通用特征相比,使用组件特定特征能否提升改写成因检测的准确性?
  • RQ3输入模态(语音 vs. 文本)和输入类型切换如何影响改写成因预测?
  • RQ4哪些特征对特定错误类型(如ASR、NLU、LG)具有最强预测能力?

主要发现

  • 所提出的结合组件特定特征的方法,实现了0.66的宏平均F1得分,优于基线模型的0.47。
  • ASR相关特征(如ASRConf和Voice2Text)显著提升了ASR错误的检测能力,减少了将‘无错误’误判为‘ASR错误’的情况。
  • Text2Voice和InputType等特征在检测NLU错误方面尤为有效,特别是在文本转语音的改写模式中。
  • 模型在‘无错误’和‘ASR错误’类别上的表现最佳,而在‘NLU’和‘LG’类别上表现较差,原因在于这两类的训练样本较少。
  • 特征权重分析表明,组件特定特征(如NLU的SameIntent、LG的DialogAct)被有效学习,并与预期的错误模式一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。