[论文解读] Sparse*BERT: Sparse Models Generalize To New tasks and Domains
本文提出 Sparse*BERT,一种在通用领域预训练期间通过渐进式非结构化剪枝训练的剪枝 BERT 模型,无需针对特定任务调整超参数,即可在新领域(如生物医学)实现有效泛化。所得到的 SparseBioBERT 仅使用 10% 的参数量,性能达到 BioBERT 水平,展现出强大的零样本迁移能力,并在多种生物医学 NLP 任务和数据稀疏场景下表现出强鲁棒性。
Large Language Models have become the core architecture upon which most modern natural language processing (NLP) systems build. These models can consistently deliver impressive accuracy and robustness across tasks and domains, but their high computational overhead can make inference difficult and expensive. To make using these models less costly, recent work has explored leveraging structured and unstructured pruning, quantization, and distillation to improve inference speed and decrease size. This paper studies how models pruned using Gradual Unstructured Magnitude Pruning can transfer between domains and tasks. Our experimentation shows that models that are pruned during pretraining using general domain masked language models can transfer to novel domains and tasks without extensive hyperparameter exploration or specialized approaches. We demonstrate that our general sparse model Sparse*BERT can become SparseBioBERT simply by pretraining the compressed architecture on unstructured biomedical text. Moreover, we show that SparseBioBERT can match the quality of BioBERT with only 10\% of the parameters.
研究动机与目标
- 探究在未进行大量超参数调优的情况下,剪枝的大规模语言模型是否能有效泛化到新领域和新任务。
- 评估剪枝阶段(预训练 vs. 微调)对生物医学 NLP 中迁移性能的影响。
- 开发一种稀疏的通用模型,可通过极少的领域特定预训练,适配至专业领域。
- 证明稀疏模型可在显著减少参数量的同时,达到或超越稠密模型的性能。
提出的方法
- 通过在未标记的 BERT 上进行通用领域预训练期间,采用渐进式非结构化剪枝方法实施剪枝。
- 将剪枝后的架构在特定领域的生物医学文本上进行微调,以构建 SparseBioBERT,即一个专用的稀疏模型。
- 在微调过程中使用知识蒸馏,温度设为 2.0,软性损失权重为 0.8,以保持性能。
- 在多个生物医学数据集上评估模型在实体识别、关系抽取和问答任务上的表现。
- 系统性地改变训练数据规模(从 1% 到 100%),以评估样本效率和对数据稀缺的鲁棒性。
- 实验对比了在预训练阶段剪枝的模型(Sparse*BERT)、在微调阶段剪枝的模型以及稠密 BERT 在所有设置下的性能。
实验结果
研究问题
- RQ1在通用领域数据上训练的剪枝大语言模型,是否能在不进行额外超参数调优的情况下,有效迁移到新领域?
- RQ2在低资源生物医学 NLP 任务中,预训练阶段剪枝是否优于微调阶段剪枝,从而带来更好的迁移性能?
- RQ3在数据稀缺条件下,模型稀疏性如何影响性能表现?与稠密模型相比,其样本效率如何?
- RQ4是否可以通过极少的领域特定预训练,将单一稀疏架构适配至新领域(如生物医学),以实现与稠密领域专用模型相当的性能?
主要发现
- Sparse*BERT 在通用领域预训练阶段完成剪枝,在生物医学 NLP 任务中仅使用 10% 的活跃参数,即可达到与 BioBERT 相当的性能。
- 在实体识别任务上,预训练阶段剪枝比微调阶段剪枝高出近 4 个百分点,在整体性能上高出约 2 个百分点,甚至超过了 BERT 与 BioBERT 之间的性能差距。
- Sparse*BERT 在不同规模的训练数据下均保持高性能,F1 分数仅从 100% 数据量下的 88.50 略降至 1% 数据量下的 60.91,而微调后的剪枝模型则迅速退化。
- 在小规模数据集(如 NCBI 和 GAD)上,微调阶段剪枝的模型出现显著准确率下降,而 Sparse*BERT 保持了强鲁棒性。
- 在预训练阶段剪枝的模型比在微调阶段剪枝的模型泛化能力更强,尤其在低数据场景下,表明早期剪枝有助于保留迁移能力。
- SparseBioBERT 在其参数量下实现了最先进性能,仅用 90% 更少的活跃参数,即可达到与 BioBERT 相当的准确率,且无需针对任务进行优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。