Skip to main content
QUICK REVIEW

[论文解读] CUGE: A Chinese Language Understanding and Generation Evaluation Benchmark

Yuan Yao, Qingxiu Dong|arXiv (Cornell University)|Dec 27, 2021
Topic Modeling被引用 7
一句话总结

CUGE 是一个全面的、分层的基准,用于评估中文语言理解与生成能力,其结构围绕语言能力、任务和数据集展开,并采用多级评分策略,将性能相对于基线进行归一化。实验表明,不同能力之间存在显著的性能差距,表明尽管在特定任务上表现良好,通用语言智能仍有巨大的提升空间。

ABSTRACT

Realizing general-purpose language intelligence has been a longstanding goal for natural language processing, where standard evaluation benchmarks play a fundamental and guiding role. We argue that for general-purpose language intelligence evaluation, the benchmark itself needs to be comprehensive and systematic. To this end, we propose CUGE, a Chinese Language Understanding and Generation Evaluation benchmark with the following features: (1) Hierarchical benchmark framework, where datasets are principally selected and organized with a language capability-task-dataset hierarchy. (2) Multi-level scoring strategy, where different levels of model performance are provided based on the hierarchical framework. To facilitate CUGE, we provide a public leaderboard that can be customized to support flexible model judging criteria. Evaluation results on representative pre-trained language models indicate ample room for improvement towards general-purpose language intelligence. CUGE is publicly available at cuge.baai.ac.cn.

研究动机与目标

  • 为解决现有扁平化、以数据集为中心的基准在评估通用语言智能方面的局限性。
  • 设计一个系统化、全面的中文 NLP 评估框架,以反映人类在多个层次上的语言能力。
  • 提供一个灵活、可定制的评估平台,并配备公开排行榜,以支持多样化的模型评估标准。
  • 通过归一化评分,实现对数据集、任务和语言能力的多级性能分析。
  • 通过揭示预训练模型在不同语言能力上进展的不平衡性,为未来研究提供指导。

提出的方法

  • CUGE 将数据集组织在语言能力、任务和数据集的分层框架内,灵感来源于人类语言考试教学大纲和当前的 NLP 研究。
  • 采用多级评分策略,将模型在每个数据集上的性能相对于标准基线(mT5-Small)进行归一化,以减轻度量和数据集差异的影响。
  • 该基准包含 7 种语言能力、18 项任务和 21 个代表性数据集,重点关注理解、生成和推理能力的覆盖。
  • 构建了一个公开的在线评估平台,支持可定制的排行榜,允许用户选择特定能力或任务进行评估。
  • 通过荣誉准则保障学术诚信,并通过共享代码和方法报告鼓励透明性。
  • 系统支持能力级别的性能可视化,并具备未来扩展新数据集和评估功能的能力。

实验结果

研究问题

  • RQ1如何系统性地构建一个中文语言智能基准,以全面反映人类语言能力的全谱?
  • RQ2当前的预训练模型在理解、生成和推理等不同语言能力上,其性能在多大程度上是均衡的?
  • RQ3一种相对于基线进行性能归一化的多级评分策略,能否提高模型评估的可靠性和可解释性?
  • RQ4在统一的分层基准下,模型性能在不同语言能力上的表现如何变化?
  • RQ5现有扁平化、以数据集为中心的基准在捕捉通用语言智能复杂性方面存在哪些局限?

主要发现

  • mT5-XXL 显著优于 mT5-Large 和 mT5-Small,表明模型规模增大可显著提升大多数能力的性能。
  • CPM-2 尽管参数量少于 mT5-XXL,但表现更优,表明改进的预训练方法可带来更强的语言能力。
  • 性能提升在不同语言能力之间极不平衡,多语言能力的提升幅度大于语言生成能力。
  • 分层框架使得能够进行扁平基准无法实现的模型性能细节分析,揭示了特定能力的薄弱点。
  • 该基准揭示了通用语言智能仍有巨大提升空间,尤其是在生成和语篇级理解方面。
  • 可定制的排行榜和位于 cuge.baai.ac.cn 的公开平台,支持对中文 NLP 模型进行灵活、透明且可复现的评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。