Skip to main content
QUICK REVIEW

[论文解读] Evaluating Attribution in Dialogue Systems: The BEGIN Benchmark

Nouha Dziri, Hannah Rashkin|arXiv (Cornell University)|Apr 30, 2021
Topic Modeling被引用 5
一句话总结

本文提出了 BEGIN,一个包含从知识增强型模型中收集的 12,000 个对话回合的大规模基准,用于评估生成回复中的归因问题。通过在三个类别——完全可归因、不完全可归因和通用性——上的人工标注标签,研究揭示了现有自动指标依赖虚假相关性、无法区分抽象但忠实的回复,且在长知识源上性能显著下降,凸显了对更稳健评估指标的迫切需求。

ABSTRACT

Knowledge-grounded dialogue systems powered by large language models often generate responses that, while fluent, are not attributable to a relevant source of information. Progress towards models that do not exhibit this issue requires evaluation metrics that can quantify its prevalence. To this end, we introduce the Benchmark for Evaluation of Grounded INteraction (BEGIN), comprised of 12k dialogue turns generated by neural dialogue systems trained on three knowledge-grounded dialogue corpora. We collect human annotations assessing the extent to which the models' responses can be attributed to the given background information. We then use BEGIN to analyze eight evaluation metrics. We find that these metrics rely on spurious correlations, do not reliably distinguish attributable abstractive responses from unattributable ones, and perform substantially worse when the knowledge source is longer. Our findings underscore the need for more sophisticated and robust evaluation metrics for knowledge-grounded dialogue. We make BEGIN publicly available at https://github.com/google/BEGIN-dataset.

研究动机与目标

  • 解决知识增强型对话系统中归因评估缺乏大规模、可靠基准的问题。
  • 识别现有自动指标在声称衡量生成回复的忠实性或归因性时的不足之处。
  • 开发一个基准,以在分布偏移和多样化回复类型下实现对指标的元评估。
  • 利用人工标注数据,区分真正可归因、不可归因和通用性回复。
  • 提供一个公开资源,以加速开发稳健、可泛化的基于知识的对话评估指标的研究。

提出的方法

  • 作者从四个在三个知识增强型语料库(Wizard of Wikipedia、CMU 开放域对话、TopicalChat)上训练的神经对话系统中收集了 12,000 个对话回合。
  • 他们建立了一个人工标注的分类体系,包含三种回复类别:完全可归因、不完全可归因和通用性(如“我不确定”)。
  • 人工标注者根据回复中的所有信息是否均得到背景文档支持,或是否包含未经支持的陈述或无信息内容,对每个回复进行标注。
  • 该基准用于评估八种自动指标:词重叠类(BLEU、ROUGE)、基于嵌入的(BERTScore、BARTScore、BLEURT)、基于问答的和基于自然语言推理的指标。
  • 他们还使用对抗生成的数据训练了一个分类器,以评估其与源文档的一致性。
  • 评估指标与人工判断的相关性及其在知识源变长时的鲁棒性,尤其关注分布偏移的影响。

实验结果

研究问题

  • RQ1现有自动指标在多大程度上与人工判断的归因评估相关?
  • RQ2评估指标在多大程度上依赖虚假相关性(如词汇重叠),而非语义忠实性?
  • RQ3在抽象但完全可归因的回复与提取但不可归因的回复之间,指标表现如何?
  • RQ4当知识源变长时,指标性能如何下降,是否表明存在分布偏移下的鲁棒性问题?
  • RQ5对抗生成的数据能否提升指标分类器在检测归因错误方面的鲁棒性?

主要发现

  • 所有评估的自动指标均显著依赖虚假相关性,尤其是词汇重叠,而非语义忠实性。
  • 指标无法有效区分抽象但完全可归因的回复与不可归因的回复,常将前者错误分类为不忠实。
  • 在基于较长知识源的回复上,指标性能显著下降,表明其在分布偏移下鲁棒性差。
  • 表现最佳的指标(BERTScore)与人工判断的相关性仍然较低,尤其在复杂或抽象的回复上。
  • 对抗训练的分类器表现有所提升,但泛化能力仍有限,凸显了对更优训练数据和评估框架的需求。
  • 该基准揭示,通用性回复(如“我不确定”)常被错误分类为不可归因,提示需改进指标设计以保留自然对话行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。