Skip to main content
QUICK REVIEW

[论文解读] Interactive Evaluation of Dialog Track at DSTC9

Shikib Mehri, Yulan Feng|arXiv (Cornell University)|Jul 28, 2022
Topic Modeling被引用 5
一句话总结

本文介绍了 DSTC9 对话系统交互式评估赛道,通过 DialPort 平台上的真实用户互动评估开放域对话系统。结果表明,与静态基准相比,使用对话长度和 FED 等指标进行真实用户交互评估能提供更强大、更可靠的系统质量评估,且每条可用对话的成本低于 1 美元,共收集了 4,000 多条对话。

ABSTRACT

The ultimate goal of dialog research is to develop systems that can be effectively used in interactive settings by real users. To this end, we introduced the Interactive Evaluation of Dialog Track at the 9th Dialog System Technology Challenge. This track consisted of two sub-tasks. The first sub-task involved building knowledge-grounded response generation models. The second sub-task aimed to extend dialog models beyond static datasets by assessing them in an interactive setting with real users. Our track challenges participants to develop strong response generation models and explore strategies that extend them to back-and-forth interactions with real users. The progression from static corpora to interactive evaluation introduces unique challenges and facilitates a more thorough assessment of open-domain dialog systems. This paper provides an overview of the track, including the methodology and results. Furthermore, it provides insights into how to best evaluate open-domain dialog models

研究动机与目标

  • 通过引入真实用户交互评估,推动开放域对话系统评估超越静态数据集。
  • 激励参与者构建强大的响应生成模型,并使其能够有效与真实用户进行双向互动。
  • 验证交互式评估作为比静态基准更全面的评估方法的可行性和价值。
  • 探索在开放式、交互式对话设置中与人类判断相关的自动评估指标。
  • 证明真实用户互动数据,尤其是对话长度,是系统质量的强有力预测指标。

提出的方法

  • 参赛者基于 Topical-Chat 语料库开发了知识增强型响应生成模型,用于子任务 1(静态评估)。
  • 在子任务 2 中,模型被部署在 DialPort 网页平台上,与通过 Facebook 广告招募的真实用户进行互动。
  • 交互式评估采用纯文本、基于网页的界面,避免语音识别错误,收集真实用户的对话会话。
  • 该平台支持所有系统同时评估,以减少时间偏差并确保挑战水平的一致性。
  • 应用了 FED 和 USR 等自动评估指标,以在无需参考响应的情况下预测人类判断。
  • 系统性能通过人工评估、对话长度以及自动指标与人类排名之间的相关性分析进行评估。

实验结果

研究问题

  • RQ1与静态基准相比,真实用户参与的交互式评估能否提供更全面、更可靠的开放域对话系统评估?
  • RQ2在交互式、开放域对话设置中,FED 和 USR 等自动评估指标与人类判断的相关性如何?
  • RQ3在真实用户互动中,对话长度在多大程度上可作为系统质量的可靠代理指标?
  • RQ4哪些策略能使响应生成模型在与真实用户的动态双向互动中实现有效泛化?
  • RQ5如何在保持方法严谨性和一致性的前提下,实现交互式评估的低成本规模化?

主要发现

  • 交互式评估共收集了超过 4,000 条对话(其中 2,960 条对话至少包含 4 轮),每条可用对话的成本低于 1.00 美元,证明了大规模交互式评估的可行性。
  • FED 指标与人类判断在系统层面的斯皮尔曼等级相关系数为 0.49(p=0.13),正确预测了表现最好的两个系统,表明其具有中等预测能力。
  • 平均对话长度与系统质量表现出强烈相关性(斯皮尔曼等级相关系数 r=0.94,p<0.01),表明用户更倾向于与性能更好的系统进行更长时间的互动。
  • 在两个子任务中排名前三的模型均使用了预训练语言模型,并引入了响应重排序或过滤机制,凸显了稳健模型流水线的重要性。
  • 结果验证了交互式评估能够捕捉静态评估所忽略的关键对话特性——一致性、适应性与错误恢复能力。
  • 研究证实,真实用户互动对于评估对话系统至关重要,因为用户参与度和对话长度是系统有效性的强有力指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。