Skip to main content
QUICK REVIEW

[论文解读] Masking as an Efficient Alternative to Finetuning for Pretrained Language Models

Mengjie Zhao, Tao Lin|arXiv (Cornell University)|Apr 26, 2020
Topic Modeling被引用 13
一句话总结

本文提出掩码学习——为预训练语言模型权重学习选择性二值掩码——作为微调的参数高效替代方法。通过保留预训练权重并为每个任务仅训练1比特掩码,该方法在11项NLP任务上实现了与微调相当的性能,同时显著降低了内存使用量,尤其适用于多任务部署。

ABSTRACT

We present an efficient method of utilizing pretrained language models, where we learn selective binary masks for pretrained weights in lieu of modifying them through finetuning. Extensive evaluations of masking BERT and RoBERTa on a series of NLP tasks show that our masking scheme yields performance comparable to finetuning, yet has a much smaller memory footprint when several tasks need to be inferred simultaneously. Through intrinsic evaluations, we show that representations computed by masked language models encode information necessary for solving downstream tasks. Analyzing the loss landscape, we show that masking and finetuning produce models that reside in minima that can be connected by a line segment with nearly constant test accuracy. This confirms that masking can be utilized as an efficient alternative to finetuning.

研究动机与目标

  • 为解决在同时部署多个任务时微调大型预训练语言模型带来的高内存成本问题。
  • 探究通过二值掩码进行选择性参数剪枝是否能在不更新任何预训练权重的情况下达到与微调相当的性能。
  • 评估掩码作为微调的参数高效替代方法在多样化NLP任务中的有效性。
  • 分析掩码模型的泛化能力和损失景观特性,以理解掩码为何能实现具有竞争力的性能。

提出的方法

  • 该方法为每个下游任务训练一组可学习的二值掩码,应用于预训练模型的注意力和前馈层。
  • 使用直通估计器对二值掩码进行端到端优化,以实现对离散掩码值的反向传播。
  • 最终模型仅使用掩码后的权重(即原始预训练权重乘以二值掩码),所有原始参数保持不变。
  • 该方法在BERT、RoBERTa和DistilBERT上应用于11项多样化的NLP任务,包括序列分类、命名实体识别和阅读理解。
  • 通过仅存储二值掩码而非完整的微调权重,该方法实现了参数高效的集成。
  • 通过沿线段插值连接微调模型和掩码模型,开展模式连通性分析,以评估损失景观的相似性。

实验结果

研究问题

  • RQ1为预训练权重学习二值掩码是否能在多样化NLP任务上实现与完整微调相当的性能?
  • RQ2在同时部署多个下游任务时,掩码的内存效率与微调相比如何?
  • RQ3掩码模型所学习的表征是否为下游任务性能提供了足够信息?
  • RQ4掩码和微调找到的极小值在损失景观中是否通过一条线段相连,表明其优化路径相似?
  • RQ5哪些因素会影响掩码机制在不同模型和任务上的性能表现?

主要发现

  • 掩码在11项多样化NLP任务(包括MRPC、SST-2和CoNLL-2003)上实现了与微调相当的性能,准确率无显著下降。
  • 掩码的内存占用大幅降低——每个参数每任务仅需1比特,使其特别适合在边缘设备上进行多任务部署。
  • 内在评估结果确认,掩码模型能够提取出对下游任务具有泛化性和信息量的表征。
  • 损失景观分析显示,掩码和微调找到的极小值通过一条线段相连,且测试准确率几乎保持恒定,表明其优化质量相似。
  • BERT深层的掩码在不同任务间差异更大,表明深层具有更高的任务特异性,与微调研究结果一致。
  • 不同随机初始化的掩码产生相似性能,支持存在多个有效子网络,与彩票假说一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。