Skip to main content
QUICK REVIEW

[论文解读] EditEval: An Instruction-Based Benchmark for Text Improvements

Jane Dwivedi-Yu, Timo Schick|arXiv (Cornell University)|Sep 27, 2022
Software Engineering Research被引用 8
一句话总结

EditEval 是一个统一的、基于指令的基准,用于评估语言模型在迭代文本编辑任务(如改写、流畅度提升、中性化处理和信息更新)上的表现。它对多样化数据集进行标准化,使用多种指标评估最先进模型,并发现尽管 InstructGPT 和 PEER 表现最佳,但大多数模型在信息更新和中性化处理任务上仍显著落后于监督式最先进模型,且各项指标之间相关性差,对提示词敏感。

ABSTRACT

Evaluation of text generation to date has primarily focused on content created sequentially, rather than improvements on a piece of text. Writing, however, is naturally an iterative and incremental process that requires expertise in different modular skills such as fixing outdated information or making the style more consistent. Even so, comprehensive evaluation of a model's capacity to perform these skills and the ability to edit remains sparse. This work presents EditEval: An instruction-based, benchmark and evaluation suite that leverages high-quality existing and new datasets for automatic evaluation of editing capabilities such as making text more cohesive and paraphrasing. We evaluate several pre-trained models, which shows that InstructGPT and PEER perform the best, but that most baselines fall below the supervised SOTA, particularly when neutralizing and updating information. Our analysis also shows that commonly used metrics for editing tasks do not always correlate well, and that optimization for prompts with the highest performance does not necessarily entail the strongest robustness to different models. Through the release of this benchmark and a publicly available leaderboard challenge, we hope to unlock future research in developing models capable of iterative and more controllable editing.

研究动机与目标

  • 解决当前语言模型在迭代式、模块化文本编辑任务中缺乏全面评估的问题,该问题与人类写作实践形成对比。
  • 识别并标准化跨领域的高质量数据集,用于评估编辑能力,如连贯性、简化和信息更新。
  • 开发一个统一的评估框架,支持基于指令的提示方式和多种指标,以实现一致的基准测试。
  • 评估最先进模型在编辑任务中的表现,并分析提示词的鲁棒性以及不同指标之间的相关性。
  • 通过开源代码、数据和公开排行榜,支持未来在可控、迭代式文本生成方面的研究。

提出的方法

  • 将现有和新数据集(如 WAFER-insert)聚合并标准化为单一、一致的格式,用于评估。
  • 设计针对特定任务的人工标注指令,涵盖中性化、简化、流畅度、改写和信息更新等编辑任务。
  • 使用标准指标(如 BLEU、ROUGE、SARI、EM-Diff 和 UpdateROUGE)评估多种预训练模型(如 GPT-3、OPT、InstructGPT、PEER)。
  • 在数据集和提示词层面测量模型表现,以评估其鲁棒性和对提示词措辞的敏感性。
  • 通过皮尔逊相关系数在不同模型和任务之间分析指标相关性,以评估其可靠性和一致性。
  • 发布该基准,配套提供代码、数据和公开排行榜,以支持可复现性和社区范围的评估。

实验结果

研究问题

  • RQ1现有预训练语言模型在基于指令的文本编辑任务(如改写、流畅度和信息更新)上的表现如何?
  • RQ2常用自动指标(如 BLEU、ROUGE、SARI)在编辑评估中彼此之间以及与人类判断的相关性如何?
  • RQ3提示词措辞如何影响不同编辑任务和模型上的模型表现与鲁棒性?
  • RQ4统一的基准能否有效评估跨多个领域和任务的多样化编辑能力?
  • RQ5当前评估指标和模型行为在迭代式文本编辑中的主要局限性是什么?

主要发现

  • InstructGPT 和 PEER 在各项编辑任务中表现最佳,但大多数基线模型在中性化和信息更新任务上仍显著落后于监督式最先进模型。
  • 常用指标如 ROUGE 和 BLEU 之间相关性较低(例如,相关系数在 -0.29 到 -0.1 之间),且 ROUGE 常与其他指标(如 SARI 和 UpdateROUGE)产生冲突。
  • 为最大化性能而优化的提示词并不总是对所有模型都具有鲁棒性;例如,用于清晰度的提示 #5 虽得分最高,但四分位距(IQR)最大,表明方差较高。
  • 部分提示词因措辞模糊或不常见(如“去除观点”或“重写这段文字”而缺乏具体性)而鲁棒性较差,导致模型行为不一致。
  • 连贯性、改写和中性化等任务表现出显著的异常值行为,通常由于 T0(表现差)与 InstructGPT/PEER(表现优)等模型之间存在极端性能差异所致。
  • 该基准揭示,仅优化提示词性能并不能保证鲁棒性,凸显了系统性提示选择和更优评估指标的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。