Skip to main content
QUICK REVIEW

[论文解读] GLGE: A New General Language Generation Evaluation Benchmark

Dayiheng Liu, Yu Yan|arXiv (Cornell University)|Nov 24, 2020
Topic Modeling参考文献 43被引用 9
一句话总结

本文提出了GLGE,这是首个全面的多任务基准,用于评估自然语言生成(NLG)模型的泛化能力,涵盖八个NLG任务的24个子任务,分为三个难度级别(简单、中等、困难)。该基准评估了SOTA的预训练模型如BART和ProphetNet,揭示了在更难任务上存在显著的性能差距,并提供了开源数据集、标准化指标和公开排行榜,以加速NLG研究。

ABSTRACT

Multi-task benchmarks such as GLUE and SuperGLUE have driven great progress of pretraining and transfer learning in Natural Language Processing (NLP). These benchmarks mostly focus on a range of Natural Language Understanding (NLU) tasks, without considering the Natural Language Generation (NLG) models. In this paper, we present the General Language Generation Evaluation (GLGE), a new multi-task benchmark for evaluating the generalization capabilities of NLG models across eight language generation tasks. For each task, we continue to design three subtasks in terms of task difficulty (GLGE-Easy, GLGE-Medium, and GLGE-Hard). This introduces 24 subtasks to comprehensively compare model performance. To encourage research on pretraining and transfer learning on NLG models, we make GLGE publicly available and build a leaderboard with strong baselines including MASS, BART, and ProphetNet (The source code and dataset are publicly available at https://github.com/microsoft/glge).

研究动机与目标

  • 为解决自然语言生成(NLG)模型泛化能力评估中缺乏全面、标准化基准的问题。
  • 设计一个涵盖多样化NLG任务的多任务基准,涵盖不同输入/输出长度、文本类型和数据集规模。
  • 为每个任务引入三个难度级别(简单、中等、困难),以实现对模型能力的细粒度评估。
  • 提供标准化的评估指标和自动化脚本,确保模型比较的一致性。
  • 通过发布开源数据集并维护公开排行榜,推动NLG预训练和迁移学习研究。

提出的方法

  • 该基准包含八个核心NLG任务:文本摘要、问题生成、生成式问答、对话回复生成等,这些任务因任务多样性与可评估性而被选中。
  • 针对八个任务中的每一个,创建三个难度递增的子任务——GLGE-简单、GLGE-中等、GLGE-困难,依据输入复杂度和生成约束而定。
  • 复用六个现有数据集,并从真实应用场景引入两个新数据集,以增强实际相关性和多样性。
  • 在所有任务中统一应用标准化的自动评估指标(如BLEU、ROUGE),以确保公平且一致的比较。
  • 基线模型包括非预训练模型(如普通LSTM、Transformer)和SOTA预训练模型(如MASS、BART、ProphetNet),用于对比评估。
  • 维护一个公开排行榜,以追踪并激励模型在基准上的性能提升。

实验结果

研究问题

  • RQ1与非预训练模型相比,BART和ProphetNet等预训练NLG模型在多样化的一般化NLG任务上的表现如何?
  • RQ2与简单子任务(GLGE-简单)相比,模型在更难子任务(GLGE-困难)上的性能下降程度如何?
  • RQ3在多样化的NLG生成任务中,标准自动评估指标与人工判断的相关性如何?
  • RQ4所提出的基准能否有效区分具有不同容量和预训练范围的模型?
  • RQ5当前预训练NLG模型在处理复杂、高难度生成任务方面存在哪些关键局限?

主要发现

  • BART和ProphetNet等预训练NLG模型在所有GLGE子任务中显著优于非预训练模型(如普通LSTM和Transformer)。
  • 尽管在简单任务上表现良好,预训练模型在最具挑战性的GLGE-困难子任务上仍存在显著的提升空间。
  • n-gram多样性分析表明,即使是最先进的模型,其生成输出的多样性仍不足,表明NLG中需更好的多样性控制。
  • 模型性能差距在复杂任务(如抽象式摘要和答案感知问题生成)中最为显著。
  • 该基准成功识别出模型在处理长上下文输入、罕见实体和复杂推理任务中的弱点。
  • 公开排行榜和标准化评估框架已开始支持社区范围的模型对比与进展追踪。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。