Skip to main content
QUICK REVIEW

[论文解读] Target-Guided Open-Domain Conversation Planning

Yosuke Kishinami, Reina Akama|arXiv (Cornell University)|Sep 20, 2022
Topic Modeling被引用 8
一句话总结

本文提出了目标引导的开放域对话规划(TGCP)框架,用于评估神经对话智能体生成多轮对话计划以引导对话达到目标词的能力。该方法通过自我对话模拟进行前瞻规划,揭示了当前模型在实现目标与保持自然、可信对话之间存在权衡,尽管优化子目标策略可提升性能。

ABSTRACT

Prior studies addressing target-oriented conversational tasks lack a crucial notion that has been intensively studied in the context of goal-oriented artificial intelligence agents, namely, planning. In this study, we propose the task of Target-Guided Open-Domain Conversation Planning (TGCP) task to evaluate whether neural conversational agents have goal-oriented conversation planning abilities. Using the TGCP task, we investigate the conversation planning abilities of existing retrieval models and recent strong generative models. The experimental results reveal the challenges facing current technology.

研究动机与目标

  • 为解决现有目标导向对话人工智能中缺乏显式规划的问题,后者常将目标达成视为单步任务。
  • 提出一种新的评估框架——目标引导的开放域对话规划(TGCP),在无需人类参与的情况下评估多轮对话规划能力。
  • 探究当前检索模型与生成模型是否能够生成连贯、目标导向的对话计划,自然地引导至目标词。
  • 探索子目标策略如何影响目标达成与对话自然性之间的平衡。

提出的方法

  • TGCP任务要求智能体生成一系列话语(u₁,…,uₙ),从初始话语出发,最终生成包含预设目标词g₀的话语。
  • 智能体通过对自己话语生成回应,实现自我对话模拟,从而实现对潜在对话路径的前向规划。
  • 该框架使用三项指标评估模型:达成率(目标词出现情况)、过渡自然度(话语流的自然性)和对话概率(对话序列的可信度)。
  • 研究对比了检索模型(如DKRN)与生成模型(如BlenderBot)在有无子目标策略下的表现——即实时生成(CKC)与预先设计(PreDes)两种方式。
  • 人工评估用于衡量过渡自然度与对话概率,而达成率则通过自动计算获得。
  • 测试集与评估代码已公开发布,以支持可复现性与进一步基准测试。

实验结果

研究问题

  • RQ1现有检索与生成模型能否在保持连贯性的同时,自然地引导对话至目标词?
  • RQ2自我对话模拟如何使智能体在无须人类交互的情况下规划多轮对话?
  • RQ3当前模型在实现目标词与保持自然、可信对话之间存在何种权衡?
  • RQ4子目标策略(实时生成 vs. 预先设计)在多大程度上影响目标达成与对话质量之间的平衡?
  • RQ5在回合数与规划效率方面,模型生成的对话计划与人类之间的对话相比如何?

主要发现

  • 检索模型达成率较高,但在过渡自然度与对话概率方面表现较差,表明其对话流不自然或不可信。
  • 生成模型在过渡自然度与对话概率方面表现更优,但在目标达成方面存在困难,尤其在实时子目标生成(Blender+CKC)时更为明显。
  • 采用预先设计子目标策略的生成模型(Blender+PreDes)显著提升了达成率,同时保持了高自然度与可信度,优于检索模型及实时子目标变体。
  • 人类对话平均用更少回合即可达成目标,表明当前智能体在规划效率上仍不及人类。
  • 结果表明,当前神经对话智能体在目标达成与对话自然性之间存在明显权衡,而通过优化子目标策略可有效缓解该问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。