Skip to main content
QUICK REVIEW

[论文解读] The Diminishing Returns of Masked Language Models to Science

Zhi Hong, Aswathy Ajith|arXiv (Cornell University)|May 23, 2022
Topic Modeling被引用 11
一句话总结

本研究评估了模型规模、训练数据量以及预训练/微调时长对14个科学领域专用BERT模型(包括7.7亿参数的SCHOLARBERT)在12项科学信息抽取任务上的影响。研究发现,增加这些资源带来的收益呈递减趋势——F1分数提升超过1%的情况极为罕见且高度依赖任务,挑战了科学NLP中关于模型扩展优势的既有假设。

ABSTRACT

Transformer-based masked language models such as BERT, trained on general corpora, have shown impressive performance on downstream tasks. It has also been demonstrated that the downstream task performance of such models can be improved by pretraining larger models for longer on more data. In this work, we empirically evaluate the extent to which these results extend to tasks in science. We use 14 domain-specific transformer-based models (including ScholarBERT, a new 770M-parameter science-focused masked language model pretrained on up to 225B tokens) to evaluate the impact of training data, model size, pretraining and finetuning time on 12 downstream scientific tasks. Interestingly, we find that increasing model sizes, training data, or compute time does not always lead to significant improvements (i.e., >1% F1), if at all, in scientific information extraction tasks and offered possible explanations for the surprising performance differences.

研究动机与目标

  • 探究扩大模型规模、训练数据量和计算时间是否能提升科学信息抽取任务的性能。
  • 评估在大规模、多学科科学语料库上进行领域特定预训练是否能持续优于通用或小范围领域模型。
  • 评估在多样化科学文本(2250亿token)上进行预训练,相较于较小或专用语料库,对下游科学NLP任务的有效性。
  • 确定通用领域语言模型(如GPT)中观察到的缩放规律是否适用于科学导向的掩码语言模型。

提出的方法

  • 在Public.Resource.Org提供的2250亿token多学科科学语料库上,对14个基于BERT的模型(包括7个现有模型,如BERT-Base、SciBERT、PubMedBERT,以及7个新开发的SCHOLARBERT变体)进行预训练。
  • 采用RoBERTa预训练流程构建SCHOLARBERT模型,使用不同规模的数据子集(1%、10%、100%)进行训练,并通过是否加入WikiBooks进行领域适应。
  • 在12项下游科学任务上进行训练与评估:涵盖生物医学、化学和材料科学的8项命名实体识别(NER)任务和4项目句分类任务。
  • 通过五次随机运行的F1分数平均值衡量性能,并报告标准差以评估方差。
  • 从四个维度(架构、预训练方法、语料库、大小写处理)比较模型,以隔离规模与领域特异性的影响。
  • 在所有任务中采用标准化的微调协议,确保模型性能比较的公平性。

实验结果

研究问题

  • RQ1增加模型规模、训练数据或预训练时间是否能在下游科学信息抽取任务中带来一致的性能提升?
  • RQ2在大规模、多学科科学语料库(2250亿token)上进行领域特定预训练,其性能是否显著优于通用或小范围领域预训练?
  • RQ3在通用领域语言模型(如GPT)中观察到的缩放规律是否适用于科学导向的掩码语言模型?
  • RQ4在不同科学领域和任务类型之间,缩放带来的性能增益有何差异?

主要发现

  • 增加模型规模或预训练数据并未带来一致的性能提升:在12项任务中仅有15%的任务在使用更大模型或更多数据时F1提升超过1%。
  • SCHOLARBERT-XL(7.7亿参数)在12项任务中的5项上取得了最高F1分数,但与其他较小模型相比,多数任务的性能提升微乎其微(≤1% F1)。
  • 在NCBI-Disease和SciERC命名实体识别任务中,使用通用语料库(如BERT-Base)预训练的模型表现与或优于领域专用模型(如SciBERT和PubMedBERT)。
  • 在Coleridge和ChemProt句分类任务中,使用较小或非科学语料库(如SB_1)预训练的模型表现与或优于更大的科学专用模型。
  • 在预训练中加入WikiBooks(如SB_10_WB、SB_100_WB)导致多个任务性能下降,表明存在领域不匹配或过拟合风险。
  • 各模型间标准差存在显著重叠(图2和图3中的误差棒可明显看出),表明性能差异在统计上往往不够稳健,尤其对大模型而言。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。