Skip to main content
QUICK REVIEW

[论文解读] Repairing the Cracked Foundation: A Survey of Obstacles in Evaluation Practices for Generated Text

Sebastian Gehrmann, Elizabeth A. Clark|arXiv (Cornell University)|Feb 14, 2022
Topic Modeling被引用 8
一句话总结

本文综述了自然语言生成(NLG)评估中长期存在的缺陷,包括有偏见的数据集、不可靠的自动评估指标以及不一致的人工评估。文章提出应通过使用多样化指标和共享数据来编制评估报告,以突出模型的局限性。结果显示,仅有27%的近期NLG论文遵循了关键建议,数据集文档和可复现性方面存在重大缺陷。

ABSTRACT

Evaluation practices in natural language generation (NLG) have many known flaws, but improved evaluation approaches are rarely widely adopted. This issue has become more urgent, since neural NLG models have improved to the point where they can often no longer be distinguished based on the surface-level features that older metrics rely on. This paper surveys the issues with human and automatic model evaluations and with commonly used datasets in NLG that have been pointed out over the past 20 years. We summarize, categorize, and discuss how researchers have been addressing these issues and what their findings mean for the current state of model evaluations. Building on those insights, we lay out a long-term vision for NLG evaluation and propose concrete steps for researchers to improve their evaluation processes. Finally, we analyze 66 NLG papers from recent NLP conferences in how well they already follow these suggestions and identify which areas require more drastic changes to the status quo.

研究动机与目标

  • 解决自动评估与人工评估在生成文本方面存在的系统性缺陷,这些缺陷阻碍了对模型能力的准确评估。
  • 识别NLG数据集中持续存在的问题,如缺乏多样性、英语偏见以及文档不全,这些问题扭曲了评估结果。
  • 揭示发表激励(高性能表现)与对模型局限性进行严谨、透明评估之间的错配。
  • 提出评估报告作为标准化框架,通过多种指标和共享数据来记录模型的不足,以实现可复现性。
  • 呼吁整个社区采纳评估最佳实践,弥合模型性能与实际可靠性之间的差距。

提出的方法

  • 回顾过去20年对NLG评估的批评,对自动指标、人工评估和数据集设计中的问题进行分类。
  • 分析ACL、EMNLP和INLG的66篇近期NLG论文,评估其对所提评估最佳实践的遵循程度。
  • 提出评估报告,聚焦于模型局限性的因果性表述,结合自动指标、人工评估和数据发布。
  • 倡导淘汰过时指标,采用更新、更稳健的指标(如BLEURT),以使优化目标与质量保持一致。
  • 呼吁在同行评审中实施评估报告标准,提升模型开发的问责性。
  • 整合来自模型文档和正式评估流程(如Mitchell et al., 2019)的见解,以增强评估的严谨性。

实验结果

研究问题

  • RQ1当前NLG生成文本的自动评估与人工评估实践中的核心缺陷是什么?
  • RQ2在常用NLG数据集中存在的偏见和不良设计如何损害模型评估的可靠性?
  • RQ3尽管有充分证据表明其价值,为何所提出的评估方法改进措施很少被采纳?
  • RQ4近期NLG论文在评估报告、数据集文档和指标多样性方面遵循最佳实践的程度如何?
  • RQ5以模型局限性为重点的评估报告在多大程度上能提升模型透明度和长期评估的可持续性?

主要发现

  • 在分析的66篇近期NLG论文中,仅有27%遵循了关键评估建议,表明最佳实践的采纳程度普遍偏低。
  • 尽管84%的论文在多个数据集上报告了结果,但仅有一篇明确提供了数据集文档,导致未来研究者不得不重新发现其中的缺陷。
  • 大多数论文未能报告其模型的局限性,尽管有证据表明模型常出现幻觉、过拟合或在简单推理任务中失败。
  • 大多数论文依赖BLEU或ROUGE等表面指标,这些指标难以准确捕捉内容质量或事实一致性。
  • 基于标准指标的强化学习优化往往无法提升模型质量,但新型学习型指标(如BLEURT)显示出良好前景。
  • 存在强烈的激励错配:发表高性能结果被优先考虑,而非透明、聚焦局限性的评估报告。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。