Skip to main content
QUICK REVIEW

[论文解读] Automatic Construction of Evaluation Suites for Natural Language Generation Datasets

Simon Mille, Kaustubh Dhole|arXiv (Cornell University)|Jun 16, 2021
Topic Modeling参考文献 59被引用 12
一句话总结

本文提出 NL-Augmenter,一种自动生成多样化、语言学导向挑战集的框架,用于在标准独立同分布(i.i.d.)测试集之外评估自然语言生成(NLG)模型。通过在 GEM 基准上应用受控扰动和子集选择,该框架构建了 80 个挑战集,可暴露模型的脆弱性,揭示模型在罕见或系统性输入变化下的性能下降,并支持对不同架构和数据分布下模型行为的深入分析。

ABSTRACT

Machine learning approaches applied to NLP are often evaluated by summarizing their performance in a single number, for example accuracy. Since most test sets are constructed as an i.i.d. sample from the overall data, this approach overly simplifies the complexity of language and encourages overfitting to the head of the data distribution. As such, rare language phenomena or text about underrepresented groups are not equally included in the evaluation. To encourage more in-depth model analyses, researchers have proposed the use of multiple test sets, also called challenge sets, that assess specific capabilities of a model. In this paper, we develop a framework based on this idea which is able to generate controlled perturbations and identify subsets in text-to-scalar, text-to-text, or data-to-text settings. By applying this framework to the GEM generation benchmark, we propose an evaluation suite made of 80 challenge sets, demonstrate the kinds of analyses that it enables and shed light onto the limits of current generation models.

研究动机与目标

  • 为解决 NLG 基准中单一 i.i.d. 测试集的局限性,此类测试集会高估模型的泛化能力并隐藏模型弱点。
  • 开发一种可扩展、可编程的框架,用于生成多样化的、任务特定的挑战集,适用于文本到文本、文本到标量以及数据到文本的生成任务。
  • 通过识别罕见现象、系统性输入扰动和分布偏移下的性能下降,实现对模型行为的深入分析。
  • 通过创建与语言能力及受保护属性相关的子群体和扰动,提升公平性和鲁棒性评估。
  • 为数据集创建者和研究人员提供可重用、可扩展的评估套件,以增强可比性和透明度。

提出的方法

  • 利用语言学导向的扰动(如实体替换、否定、输入重排)系统性地改变输入样本,同时保持语义意图不变。
  • 从现有数据集中识别并提取感兴趣子集,包括罕见实体、代表性不足的主题以及分布外样本。
  • 集成现有评估指标(如 BLEU、ROUGE、BERTScore、BLEURT)以评估模型在扰动输入下的响应表现。
  • 使用 NL-Augmenter 框架自动化生成挑战集,支持对新 NLG 任务和数据集的可扩展性。
  • 采用多种评估指标检测学习指标在扰动下的不一致性和校准问题,尤其关注扰动下的表现。
  • 在 GEM 基准上发布 80 个挑战集,涵盖 12 个评估套件,并提供详细的数据卡片,记录所有子群体和扰动信息。

实验结果

研究问题

  • RQ1与标准测试集相比,当前 NLG 模型在系统性扰动输入下的表现如何?
  • RQ2哪些语言学和分布性变化会暴露文本到文本及文本到标量生成中模型的脆弱性?
  • RQ3标准评估指标在输入扰动下仍保持可靠性和校准性的程度如何?
  • RQ4模型规模和预训练数据分布如何影响不同挑战集下的鲁棒性?
  • RQ5围绕语言能力(如否定、指代消解)设计的挑战集能否揭示标准评估中不可见的模型捷径?

主要发现

  • 在标准 i.i.d. 测试集上的表现显著高估了模型的鲁棒性,尤其在分布外或罕见主题输入上表现更明显。
  • 模型在如输入顺序打乱等扰动下表现出显著的性能下降,表明其过度依赖输入结构而非内容。
  • 在输入重排下,输出词汇表大小增加而局部召回率下降,表明模型更依赖自回归解码而非输入特征。
  • BLEURT 在不同数据集间表现出高方差,且常与其他指标不一致,表明其可能对特定扰动敏感。
  • 与 BERTScore 和 BLEURT 相比,词袋类指标(如 BLEU 和 ROUGE)在扰动下表现出更一致且更校准的变化。
  • 该框架成功揭示了模型行为(如对微小编辑的脆弱性、对罕见实体的失败),这些在标准评估中难以被发现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。