Skip to main content
QUICK REVIEW

[论文解读] reStructured Pre-training

Weizhe Yuan, Pengfei Liu|arXiv (Cornell University)|Jun 22, 2022
Topic Modeling被引用 5
一句话总结

本文提出了重结构化预训练(RST),一种新颖的自然语言处理范式,将模型预训练与微调视为数据存储与检索过程,强调结构化信息而非原始文本。通过在包含来自10个来源的26种不同信号的重结构化数据上进行预训练,所得到的模型Qin在55项NLP基准测试中实现了最先进(SOTA)的零样本性能,并在2018年高考英语考试中取得138.5/150的高分——比平均人类表现高出40分,比参数量仅为1/16的GPT-3高出15分。

ABSTRACT

In this work, we try to decipher the internal connection of NLP technology development in the past decades, searching for essence, which rewards us with a (potential) new learning paradigm for NLP tasks, dubbed as reStructured Pre-training (RST). In such a paradigm, the role of data will be re-emphasized, and model pre-training and fine-tuning of downstream tasks are viewed as a process of data storing and accessing. Based on that, we operationalize the simple principle that a good storage mechanism should not only have the ability to cache a large amount of data but also consider the ease of access. We achieve this by pre-training models over restructured data that consist of a variety of valuable information instead of raw data after overcoming several engineering challenges. Experimentally, RST models not only surpass strong competitors (e.g., T0) on 52/55 popular datasets from a variety of NLP tasks, but also achieve superior performance in National College Entrance Examination - English (Gaokao-English),the most authoritative examination in China. Specifically, the proposed system Qin achieves 40 points higher than the average scores made by students and 15 points higher than GPT3 with 1/16 parameters. In particular, Qin gets a high score of 138.5 (the full mark is 150) in the 2018 English exam (national paper III). We have released the Gaokao Benchmark with an online submission platform. In addition, we test our model in the 2022 College Entrance Examination English that happened a few days ago (2022.06.08), and it gets a total score of 134 (v.s. GPT3's 108).

研究动机与目标

  • 识别NLP技术发展中的潜在演化模式,并为其发展提出统一的假设。
  • 通过将关注点从原始数据转向结构化、信息丰富的数据表示,解决当前预训练范式的局限性。
  • 提出一种新的学习范式——重结构化预训练(RST),将模型预训练视为一种数据存储与访问机制。
  • 构建一个AI系统Qin,使其在无需任务特定微调的情况下,达到国家高考(高考英语)的人类水平表现。
  • 建立一个公开的基准与评估平台,用于衡量AI在真实世界、高风险教育考试(如高考英语)中的表现。

提出的方法

  • RST将预训练重新定义为存储与高效检索结构化信息的过程,其中数据被重构成提取并组织26种不同信号类型(如命名实体、词性、句法依存)的形式。
  • 该方法汇集来自10种不同来源的数据,包括维基百科、CLOTH、BEA 2019以及高考英语考试题,以构建统一、信息丰富的训练语料库。
  • 针对每种数据类型,应用专门的数据构建技术:阅读理解任务采用带或不带提示的完形填空式掩码,写作任务则采用语法错误感知的数据。
  • 使用统一目标在该重结构化数据上对模型进行预训练,以优化信息可访问性与检索效率。
  • 最终得到的通用模型Qin在55项NLP任务的零样本设置下进行评估,并在真实世界的高考英语考试中进行测试,全程未进行任何微调。
  • 通过ExplainaBoard部署了交互式排行榜与高考基准,以支持公开评估并长期追踪AI进展。

实验结果

研究问题

  • RQ1NLP技术发展中的潜在演化模式是什么?它如何指导未来创新?
  • RQ2在零样本泛化方面,基于重结构化、信息丰富的数据进行预训练,是否能超越传统基于原始文本的预训练?
  • RQ3单一统一模型在无需微调的情况下,能在高风险、真实世界的考试(如高考英语)中达到人类水平表现的程度如何?
  • RQ4如何统一并有效利用来自多个来源的多样化、异构信号,以构建单一预训练框架?
  • RQ5以数据为中心的预训练方法是否能推动教育领域中更公平、更可扩展的AI应用?

主要发现

  • RST模型在55项标准NLP基准测试中,涵盖分类、信息抽取、事实检索与文本生成等任务,实现了最先进(SOTA)的零样本性能,覆盖52项。
  • 在2018年高考英语考试(全国卷III)中,Qin模型取得138.5/150的高分——比平均人类得分高出40分,比参数量为其1/16的GPT-3高出15分。
  • 在2022年高考(2022年6月8日)中,该模型在高考英语考试中总得分为134分,超过GPT-3的108分。
  • 该模型在2018年高考英语考试的听力与阅读理解部分均获得满分,展现出在高难度、真实世界任务中的卓越表现。
  • 高考基准已发布,包含2018–2021年共10份标注的英语试卷,并配备在线提交平台,支持公开评估与AI进展的长期追踪。
  • RST的成功表明,基于结构化、信息丰富的数据进行预训练,比基于原始数据的预训练更具有效性,支持向以数据为中心的AI开发范式转型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。