[论文解读] Efficient Contextualized Representation: Language Model Pruning for Sequence Labeling
本文提出 LD-Net,一种通过在预训练语言模型中采用层选择实现高效上下文表示的方法,结合密集连接与稀疏性诱导正则化,实现无需微调的剪枝。该方法在 CoNLL03 NER 上实现了高达 91.86% 的 F1 分数,同时计算量减少超过 90%,优于更小的模型及先前方法。
Many efforts have been made to facilitate natural language processing tasks with pre-trained language models (LMs), and brought significant improvements to various applications. To fully leverage the nearly unlimited corpora and capture linguistic information of multifarious levels, large-size LMs are required; but for a specific task, only parts of these information are useful. Such large-sized LMs, even in the inference stage, may cause heavy computation workloads, making them too time-consuming for large-scale applications. Here we propose to compress bulky LMs while preserving useful information with regard to a specific task. As different layers of the model keep different information, we develop a layer selection method for model pruning using sparsity-inducing regularization. By introducing the dense connectivity, we can detach any layer without affecting others, and stretch shallow and wide LMs to be deep and narrow. In model training, LMs are learned with layer-wise dropouts for better robustness. Experiments on two benchmark datasets demonstrate the effectiveness of our method.
研究动机与目标
- 降低大型预训练语言模型在序列标注任务推理过程中的计算成本。
- 在无需昂贵微调的情况下实现模型压缩,尤其适用于具有序列依赖关系的 RNN 架构。
- 识别并仅保留针对特定下游任务最相关的模型层。
- 通过结构化剪枝在显著减小模型大小和推理成本的同时保持高性能。
- 开发一种即插即用的压缩框架,兼容现有语言模型和下游模型。
提出的方法
- 在 RNN 中引入密集连接,使各层可独立移除,从而在不破坏网络结构的前提下实现层剪枝。
- 应用稀疏性诱导正则化(修改的 L1)以鼓励二值选择权重,促进稀疏且二值的层选择。
- 在训练过程中使用层级 dropout 以提升剪枝后的鲁棒性与泛化能力。
- 采用可学习的层选择机制,识别并仅保留对目标任务最具信息量的层。
- 通过密集连接将宽而浅的 RNN 替换为深而窄的架构,实现细粒度剪枝。
- 设计一种基于层对最终任务性能贡献度的剪枝策略,避免完整微调。
实验结果
研究问题
- RQ1我们能否在不微调的情况下压缩大型预训练语言模型用于序列标注,同时保持性能?
- RQ2当标准堆叠结构阻止独立移除层时,如何实现 RNN 层的结构化剪枝?
- RQ3密集连接在实现高效且鲁棒的模型剪枝中起到什么作用?
- RQ4在序列标注任务中,层选择在多大程度上能通过减少 FLOPs 保持性能?
- RQ5经过层级 dropout 和稀疏性正则化训练的剪枝模型,是否优于更小的独立训练模型?
主要发现
- 在 CoNLL03 NER 数据集上,LD-Net 实现了 91.86% ± 0.15% 的 F1 分数,显著优于未剪枝基线模型的 90.78% ± 0.24%。
- 在剪枝超过 90% 的 FLOPs 后,剪枝模型仍保持 91.84% ± 0.14% 的 F1 分数,优于更小的模型以及先前方法如 TagLM(91.62%)和 R-ELMo(91.54%)。
- 在 CoNLL03 上,尽管计算量减少超过 90%,剪枝模型的错误率仅增加 2% 相对值,表现出极高的效率。
- 在 CoNLL00 Chunking 任务上,剪枝模型相比 NoLM 基线实现 25% 的错误率降低,尽管由于数据集较小,性能下降速度更快。
- 层选择表现出两个明显聚类:部分层被持续保留,而另一些层则频繁被剪枝,表明层重要性存在有意义的结构性模式。
- 该方法的有效性通过在多次运行和多个数据集上的稳定性能提升得到验证,即使在激进剪枝下也仅出现轻微退化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。