Skip to main content
QUICK REVIEW

[论文解读] Modeling Intent, Dialog Policies and Response Adaptation for Goal-Oriented Interactions

Saurav Sahay, Shachi H Kumar|arXiv (Cornell University)|Dec 20, 2019
Speech and dialogue systems被引用 6
一句话总结

本论文提出了一种面向儿童的数据驱动、目标导向的口语对话系统,利用 BERT 嵌入表示和多头注意力机制,以提升意图识别与对话策略学习效果。在有限标注数据条件下,该方法优于基线模型,最优性能出现在 75% 训练数据量时,并采用双注意力机制融合用户与系统记忆。

ABSTRACT

Building a machine learning driven spoken dialog system for goal-oriented interactions involves careful design of intents and data collection along with development of intent recognition models and dialog policy learning algorithms. The models should be robust enough to handle various user distractions during the interaction flow and should steer the user back into an engaging interaction for successful completion of the interaction. In this work, we have designed a goal-oriented interaction system where children can engage with agents for a series of interactions involving `Meet \\& Greet' and `Simon Says' game play. We have explored various feature extractors and models for improved intent recognition and looked at leveraging previous user and system interactions in novel ways with attention models. We have also looked at dialog adaptation methods for entrained response selection. Our bootstrapped models from limited training data perform better than many baseline approaches we have looked at for intent recognition and dialog action prediction.

研究动机与目标

  • 为 5–7 岁儿童设计一个稳健的、目标导向的对话系统,用于参与 'Meet & Greet' 和 'Simon Says' 类型的互动。
  • 利用通过 Amazon Mechanical Turk 收集的有限标注数据,提升意图识别与对话策略学习效果。
  • 通过建模用户与系统交互历史的注意力机制,增强对话管理能力。
  • 基于学习到的语言与句法特征,实现上下文恰当的响应选择。
  • 将多模态信号(语音、视觉、手势)整合至对话流程中,以实现更丰富的交互建模。

提出的方法

  • 在 Rasa NLU 框架基础上扩展 BERT 嵌入表示,并引入额外特征(词汇、句法、话语行为)以提升意图分类性能。
  • 设计一种多记忆注意力机制,结合用户历史、系统动作以及通过 RNN 注意力融合的用户-系统表征。
  • 提出一种张量融合层,用于结合用户与系统记忆表征,以增强状态追踪效果。
  • 将对话适配建模为二分类任务,使用 243 个特征,包括词干、词性标注、句法重叠度与情感极性。
  • 在 32,400 个样本(其中正例 2,753 个,负例 29,647 个)上训练决策树分类器,用于选择上下文恰当的响应模板。
  • 在通过 AMT 收集的 80 个自定义对话数据集上评估模型性能,使用 F1 分数衡量动作预测效果,响应适配则采用交叉验证评估。

实验结果

研究问题

  • RQ1预训练语言表征(如 BERT)在低资源、面向儿童的对话系统中,如何提升意图识别性能?
  • RQ2何种基于注意力的记忆机制最能有效捕捉用户与系统交互历史,以支持对话策略学习?
  • RQ3能否通过语言与句法特征,将响应适配有效建模为监督分类任务?
  • RQ4训练数据规模如何影响目标导向对话系统中意图与动作预测模型的性能?
  • RQ5多模态记忆融合对对话状态追踪与策略优化有何影响?

主要发现

  • 与传统特征集及通用句子编码器相比,BERT 嵌入表示显著提升了意图识别性能。
  • 在使用 75% 训练数据时,对话策略性能达到最优,显示出数据量增加带来的明确性能提升趋势。
  • 双注意力机制(分别关注用户与系统记忆)在动作预测任务中实现了最高的 F1 分数。
  • 对话适配分类器在交叉验证中表现优异,词干、词性标注与句法结构的特征重叠对响应选择具有显著有效性。
  • 所提出的基于注意力的记忆融合模型在 'Meet & Greet 和 Simon Says' 数据集及标准基准领域上,均优于基线 REDP 策略模型。
  • 尽管在数据有限时预测结果方差较高,但随着训练集增大,模型表现出一致的性能提升,显示出良好的可扩展性潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。