Skip to main content
QUICK REVIEW

[论文解读] Athena: Constructing Dialogues Dynamically with Discourse Constraints

Vrindavan Harrison, Juraj Juraska|arXiv (Cornell University)|Nov 21, 2020
Topic Modeling参考文献 32被引用 4
一句话总结

Athena 是一个动态的、主题无关的对话系统,通过使用话语约束来协调多个模块化响应生成器(RGs)的响应,实现在开放领域话题上的灵活、实时对话。通过避免静态对话图并利用动态知识源,Athena 在用户主导的话题中实现了更高的用户满意度,并通过针对性的系统改进降低了对用户个性和期望的敏感度。

ABSTRACT

This report describes Athena, a dialogue system for spoken conversation on popular topics and current events. We develop a flexible topic-agnostic approach to dialogue management that dynamically configures dialogue based on general principles of entity and topic coherence. Athena's dialogue manager uses a contract-based method where discourse constraints are dispatched to clusters of response generators. This allows Athena to procure responses from dynamic sources, such as knowledge graph traversals and feature-based on-the-fly response retrieval methods. After describing the dialogue system architecture, we perform an analysis of conversations that Athena participated in during the 2019 Alexa Prize Competition. We conclude with a report on several user studies we carried out to better understand how individual user characteristics affect system ratings.

研究动机与目标

  • 解决传统手工构建的对话流程图在开放领域对话代理中的可扩展性和僵化性问题。
  • 开发一种灵活、主题无关的对话管理架构,支持来自多样化来源的动态、实时响应生成。
  • 通过增强系统覆盖范围和响应能力,减少对用户个性和先前期望的依赖,从而提升用户满意度。
  • 评估用户主导话题与系统引导话题对对话质量和系统评分的影响。
  • 研究用户期望和个性对语音对话系统中感知系统质量的影响。

提出的方法

  • 对话管理器将话语约束分发给响应生成器(RGs)集群,实现在对话过程中动态、交错的响应选择。
  • 系统采用基于合约的架构,RGs 根据话语层级规则独立触发,而非预定义的状态转换。
  • 响应生成器包括动态来源,如实时知识图谱遍历、基于特征的检索以及模块化对话流程。
  • 一种新型命名实体消解系统将大型知识库与集成实体链接相结合,以提升话题中的语境对齐能力。
  • 通过 32 名和 54 名参与者的用户研究,比较了用户主导话题与系统引导话题的影响,并评估了期望和个性的影响。
  • 系统改进聚焦于深化核心话题(如恐龙、电影)的覆盖范围,以增强参与度并减少用户偏见。

实验结果

研究问题

  • RQ1用户对话题控制的偏好在多大程度上影响其对开放领域对话系统评分?
  • RQ2用户个性特征和先前期望在多大程度上影响其对对话代理的感知质量?
  • RQ3通过提升核心话题的系统覆盖范围,能否降低对用户人口统计特征和期望的敏感度?
  • RQ4动态的、基于约束的对话管理对对话质量和灵活性有何影响?
  • RQ5通过交错来自多个独立响应生成器的响应,如何增强对话的丰富性和连贯性?

主要发现

  • 当用户选择自己话题时,对话评分显著更高(p = 0.02),这与最初预期系统引导话题评分更高的假设相反。
  • 外向型用户(p = 0.019)和更尽责的用户(p = 0.003)整体评分更高,表明个性影响感知质量。
  • 初始期望更高的用户在使用后对系统的评分更低(p = 0.015),表明不切实际的期望会负面影响满意度。
  • 在聚焦核心话题的系统改进后,系统引导话题的整体评分显著提升(p = 0.04),而用户主导话题的评分保持稳定(p = .99)。
  • 用户对系统的控制感提升了 51%(p = 0.0001),且个性与期望的影响均消失,表明系统更具鲁棒性。
  • 系统话题的整体评分提升了 17%,表明增强覆盖范围可减少用户人口统计偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。