Skip to main content
QUICK REVIEW

[论文解读] NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework

Xingcheng Yao, Yanan Zheng|arXiv (Cornell University)|Nov 7, 2021
Topic Modeling参考文献 38被引用 11
一句话总结

本文提出TLM,一种无需预训练的框架,通过使用标注的任务数据作为查询,从大规模通用语料库中检索出一个小而与任务相关的子集,从而从零开始训练NLP模型。通过在检索到的数据上联合优化任务特定目标和语言建模目标,TLM在减少两个数量级训练浮点运算量(FLOPs)的同时,实现了与RoBERTa-Large相当或更优的性能。

ABSTRACT

Pretrained language models have become the standard approach for many NLP tasks due to strong performance, but they are very expensive to train. We propose a simple and efficient learning framework, TLM, that does not rely on large-scale pretraining. Given some labeled task data and a large general corpus, TLM uses task data as queries to retrieve a tiny subset of the general corpus and jointly optimizes the task objective and the language modeling objective from scratch. On eight classification datasets in four domains, TLM achieves results better than or similar to pretrained language models (e.g., RoBERTa-Large) while reducing the training FLOPs by two orders of magnitude. With high accuracy and efficiency, we hope TLM will contribute to democratizing NLP and expediting its development.

研究动机与目标

  • 为解决大规模预训练语言模型(PLMs)训练带来的高计算成本问题,该问题限制了资源有限的研究人员的使用。
  • 探索标准预训练-微调范式之外的替代方案,以大幅降低训练FLOPs,同时不损失性能。
  • 通过仅使用标注任务数据和通用语料库,实现高效、低成本的从零开始训练模型,从而推动NLP研究的普惠化。
  • 探究从大规模语料库中检索与任务相关的数据是否可以替代大规模预训练,同时保持模型的有效性。

提出的方法

  • 使用标注的任务数据作为查询,通过BM25(一种基于词法相似度的稀疏检索方法)从大规模通用语料库中检索出一个小而相关的子集。
  • 使用检索到的语料子集和标注的任务数据,从零开始训练一个基于Transformer的模型。
  • 联合优化两个目标:(1) 监督任务目标(如分类损失)和(2) 在检索到的语料子集上的掩码语言建模目标。
  • 采用标准的Transformer架构,包含多头注意力和前馈网络,端到端训练,不经过任何预训练阶段。
  • 控制模型大小和训练计算量,使其在FLOPs和模型大小方面与基线PLM(如RoBERTa-Large)相当或可比。
  • 采用基于检索的过滤机制,减少通用语料库的归纳偏置,仅聚焦于下游任务相关的知识。

实验结果

研究问题

  • RQ1模型是否可以在不进行任何大规模预训练的情况下,在NLP任务上实现具有竞争力的性能?
  • RQ2仅从大规模语料库中检索极小的、与任务相关的子集,是否足以替代完整的预训练?
  • RQ3在小而精选的语料库上,联合优化任务特定目标和语言建模目标,是否能获得优于或相当的结果?
  • RQ4与标准PLM相比,训练FLOPs可降低多少,同时仍能保持或提升模型性能?
  • RQ5所提出的TLM框架中的注意力模式与标准PLM有何不同?这些差异是否表明其学习到了更具信息量的表示?

主要发现

  • TLM在八个任务上的GLUE平均得分为82.60,与BERT-Base(82.97)相当,且在部分基准上略优于RoBERTa-Large。
  • 在ChemProt生物医学分类任务中,TLM的表现优于RoBERTa-Large,证明了其在无预训练情况下仍具备优越性能。
  • TLM将训练FLOPs降低了两个数量级——相当于将1000块V100 GPU训练一天的计算量,减少至8块GPU训练42小时。
  • 注意力可视化显示,TLM学习到了更具信息量的注意力模式,其位置头(positional heads)比例更高,垂直头(vertical heads,聚焦于[CLS]、[SEP]或句号标记)更少,相较于标准PLM。
  • 通过BM25进行检索能有效捕捉生物医学和计算机科学等专业领域中的领域特定术语,表明其具有强大的词法相关性。
  • 该框架在新闻、评论、计算机科学和生物医学科学等多种领域均保持了强劲性能,证实了其良好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。