Skip to main content
QUICK REVIEW

[论文解读] Discourse Coherence, Reference Grounding and Goal Oriented Dialogue

Baber Khalid, Malihe Alikhani|arXiv (Cornell University)|Jul 8, 2020
Speech and dialogue systems参考文献 35被引用 4
一句话总结

本文提出了一种基于连贯性的混合主导权指代沟通对话系统,其中话语结构和承诺知识图谱取代了传统的计划识别。通过强化学习优化澄清和选择策略,该系统在人机交互中实现了更高的鲁棒性和灵活性,结果显示,在使用更高不确定性阈值训练时,高置信度水平下的澄清请求增加了66.7%。

ABSTRACT

Prior approaches to realizing mixed-initiative human--computer referential communication have adopted information-state or collaborative problem-solving approaches. In this paper, we argue for a new approach, inspired by coherence-based models of discourse such as SDRT \cite{asher-lascarides:2003a}, in which utterances attach to an evolving discourse structure and the associated knowledge graph of speaker commitments serves as an interface to real-world reasoning and conversational strategy. As first steps towards implementing the approach, we describe a simple dialogue system in a referential communication domain that accumulates constraints across discourse, interprets them using a learned probabilistic model, and plans clarification using reinforcement learning.

研究动机与目标

  • 开发一种可扩展的、以连贯性为核心的混合主导权对话框架,避免依赖显式的计划识别。
  • 通过受SDRT启发的连贯关系建模话语为不断演化的承诺结构,实现对话语的全局理解。
  • 整合概率语义解析与强化学习,实现自适应的澄清和选择策略。
  • 通过众包方式招募人类参与者,评估系统在指代沟通任务中的表现。
  • 探索自监督与强化学习方法在构建灵活、目标导向对话系统中的潜力。

提出的方法

  • 系统采用基于SDRT的话语表征结构,将话语附加到不断演化的承诺与连贯关系图谱上。
  • 通过学习的概率模型执行语义解析,将话语映射为对视觉指代物的约束。
  • 强化学习智能体学习基于指代识别置信度的对话策略,以选择或请求澄清。
  • 策略通过源自CIC数据集的模拟人类交互进行训练,奖励函数被设计以平衡澄清与选择。
  • 系统根据置信度阈值(例如,P_x = 0.4 与 0.7)动态调整行为,控制澄清与选择之间的权衡。
  • 维护并更新说话者承诺的知识图谱,实现对相互理解与目标进展的推理。

实验结果

研究问题

  • RQ1能否通过SDRT风格结构建模话语连贯性,作为对话系统中基于计划模型的可扩展替代方案?
  • RQ2如何通过学习的概率模型在上下文中解析话语,以生成对指代物的约束?
  • RQ3强化学习在多大程度上可优化指代沟通中的澄清与选择策略?
  • RQ4置信度阈值(P_x)的变化如何影响系统在澄清与选择之间的平衡?
  • RQ5基于连贯性的架构能否支持混合主导权对话,使系统能够担任主导者或匹配者角色?

主要发现

  • 在较高置信度阈值(P_x = 0.7)下训练的模型,在置信度≥0.8时,澄清问题数量增加了66.7%,表明对澄清行为具有有效控制。
  • 在高置信度水平下,P_x = 0.7模型选择颜色区域的频率比P_x = 0.4模型低5.5%,证实了澄清与选择之间存在明确的权衡。
  • 系统成功捕捉了指代沟通任务中自然的人机对话模式,包括通过澄清实现协调与逐步指代。
  • 强化学习使系统能够在不显式建模对话行为或状态转移的情况下,学习自适应策略。
  • 该架构通过连贯的话语结构支持回指引用,以及混合的共识、部分共识与分歧状态。
  • 来自众包工作者的初步结果显示,该系统可在真实对话场景中支持灵活、鲁棒且目标导向的交互。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。