Skip to main content
QUICK REVIEW

[论文解读] Generative Encoder-Decoder Models for Task-Oriented Spoken Dialog Systems with Chatting Capability

Tiancheng Zhao, Allen Lu|arXiv (Cornell University)|Jun 26, 2017
Speech and dialogue systems参考文献 38被引用 13
一句话总结

本文提出了一种新颖的生成式编码器-解码器框架,用于任务导向的口语对话系统,通过实体索引实现无槽值依赖的决策和动态知识库查询。通过将任务导向对话数据与人类对话数据交错训练,模型在应对域外请求时表现出更强的鲁棒性,并在真人用户测试中实现了77.0%的任务成功率,优于基线模型在自然度和知识库精确度方面的表现。

ABSTRACT

Generative encoder-decoder models offer great promise in developing domain-general dialog systems. However, they have mainly been applied to open-domain conversations. This paper presents a practical and novel framework for building task-oriented dialog systems based on encoder-decoder models. This framework enables encoder-decoder models to accomplish slot-value independent decision-making and interact with external databases. Moreover, this paper shows the flexibility of the proposed method by interleaving chatting capability with a slot-filling system for better out-of-domain recovery. The models were trained on both real-user data from a bus information system and human-human chat data. Results show that the proposed framework achieves good performance in both offline evaluation metrics and in task success rate with human users.

研究动机与目标

  • 开发一种领域通用的任务导向对话系统,避免依赖固定的对话行为和领域特定的槽值映射。
  • 解决序列到序列模型在任务导向对话中处理未登录词(OOV)实体和动态知识库(KB)查询的问题。
  • 通过在槽填充系统中集成聊天能力,提升系统对域外(OOD)请求的鲁棒性。
  • 通过自动指标和真实人类用户交互相结合的方式评估模型性能。

提出的方法

  • 模型采用带有注意力机制的序列到序列编码器-解码器架构,基于对话历史生成系统回复。
  • 引入实体索引机制,将未登录词实体(如新地点)映射到索引表示,实现在无需训练数据中预先暴露的情况下进行知识库查询。
  • 系统通过索引实体动态查询外部知识库,以检索实时信息(如公交车时刻表)。
  • 在训练过程中将聊天数据与任务导向对话数据交错,以提升泛化能力和对域外请求的恢复能力。
  • 采用混合命名实体识别方法(CRF + 规则)提取关键实体(如地点、时间等),用于实体索引和知识库交互。
  • 模型通过模仿学习从次优的手动设计对话策略进行微调,未来具备通过强化学习进一步优化的潜力。

实验结果

研究问题

  • RQ1生成式编码器-解码器模型能否有效处理任务导向对话系统中的未登录词(OOV)实体?
  • RQ2如何将端到端的序列到序列模型适配以对接外部知识库,实现实时信息检索?
  • RQ3将聊天数据与任务导向对话数据交错是否能提升模型对域外请求的鲁棒性?
  • RQ4统一的生成式模型是否能在自动指标和真实人类评估中均实现具有竞争力的性能?

主要发现

  • EI+Attn+Chat 模型在真人用户测试中实现了77.0%的任务成功率,略高于 EI+Attn 基线模型的73.3%。
  • EI+Attn+Chat 模型的 KB 精确度显著提升至93.7%,远高于 EI+Attn 模型的88.6%,表明其在知识库查询定位方面具有更高的准确性。
  • 主观评估显示,EI+Attn+Chat 模型在自然度方面得分更高(3.53/5.0),优于 EI+Attn 模型(3.46/5.0),但正确性略低。
  • 模型在4.1%的系统回复中生成了无效输出,例如引用不存在的实体(如 [LOCATION-2]),表明解码器泛化能力存在局限。
  • 尽管槽位精确度较低(71.8% vs. 73.3%),EI+Attn+Chat 模型通过使用聊天回复有效从误解中恢复,展现出更强的整体鲁棒性。
  • 失败分析表明,模型常模仿次优教师策略的局限,尤其在处理包含多个槽位的复合语句时表现不佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。