Skip to main content
QUICK REVIEW

[论文解读] Robustness Challenges in Model Distillation and Pruning for Natural Language Understanding

Mengnan Du, Subhabrata Mukherjee|arXiv (Cornell University)|Oct 16, 2021
Topic Modeling参考文献 50被引用 4
一句话总结

本文指出,NLP 模型压缩中的知识蒸馏与剪枝会降低模型在分布外(OOD)数据上的鲁棒性,尽管其在分布内性能表现强劲。本文提出 RMC,一种利用样本不确定性的正则化框架,通过平滑训练过程来提升 OOD 泛化能力,从而在不损失各类 NLU 任务中分布内准确率的前提下,减少对简单/捷径样本的过拟合。

ABSTRACT

Recent work has focused on compressing pre-trained language models (PLMs) like BERT where the major focus has been to improve the in-distribution performance for downstream tasks. However, very few of these studies have analyzed the impact of compression on the generalizability and robustness of compressed models for out-of-distribution (OOD) data. Towards this end, we study two popular model compression techniques including knowledge distillation and pruning and show that the compressed models are significantly less robust than their PLM counterparts on OOD test sets although they obtain similar performance on in-distribution development sets for a task. Further analysis indicates that the compressed models overfit on the shortcut samples and generalize poorly on the hard ones. We further leverage this observation to develop a regularization strategy for robust model compression based on sample uncertainty. Experimental results on several natural language understanding tasks demonstrate that our bias mitigation framework improves the OOD generalization of the compressed models, while not sacrificing the in-distribution task performance.

研究动机与目标

  • 探究通过知识蒸馏与剪枝压缩的模型在分布外(OOD)数据上是否仍能保持与全尺寸预训练语言模型(PLMs)相当的鲁棒性。
  • 分析压缩模型在 OOD 数据上泛化能力差的原因,特别是其对简单或捷径样本的过拟合倾向。
  • 开发一种通用的正则化框架,在模型压缩过程中提升 OOD 泛化能力,同时保持分布内性能。
  • 量化压缩程度对偏差与鲁棒性的影响,尤其关注样本难度的关系。

提出的方法

  • 通过从教师模型剪枝得到的多个子网络的预测方差来估计样本难度。
  • 将此不确定性度量用作样本特定的加权因子,以平滑知识蒸馏与微调过程。
  • 在蒸馏与剪枝过程中应用实例级平滑,通过基于估计样本不确定性的损失权重调整。
  • 将基于不确定性的正则化整合到知识蒸馏与迭代剪枝流水线中。
  • 使用不确定性感知的损失函数训练压缩模型,以减少对简单/捷径样本的过拟合,并提升对困难样本的学习效果。
  • 在多个 NLU 任务上评估该框架,使用标准的分布内与 OOD 测试集,包括 HANS 与文本蕴含基准。

实验结果

研究问题

  • RQ1在分布外(OOD)测试集上,蒸馏与剪枝模型是否与 PLM 对应模型一样鲁棒?
  • RQ2压缩程度的变化如何影响压缩模型的 OOD 泛化能力与偏差?
  • RQ3能否利用样本不确定性来正则化模型压缩过程,从而提升不同难度样本上的泛化能力?
  • RQ4基于不确定性的平滑方法是否能减少对简单/捷径样本的过拟合,同时提升对困难样本的性能?

主要发现

  • 在 MNLI 任务中,RMC 在 HANS 基准上的 OOD 泛化准确率相比基线微调最高提升 6.9 个百分点,且在所有稀疏度水平下均保持一致增益。
  • 在迭代剪枝中,RMC 框架使相对偏差度量 $\mathcal{F}_{\text{bias}}$ 相比基线微调降低 10%;在知识蒸馏中降低 10.4%。
  • 在 MNLI 任务中,知识蒸馏下 RMC 将困难样本与简单样本之间的性能差距缩小 11.3%,在 40% 稀疏度下的剪枝中缩小 10.6%。
  • 在 QQP 任务中,RMC 同时提升了分布内开发集与 OOD 测试集的性能,表明其与标准性能之间无权衡关系。
  • 压缩模型在 OOD 数据上始终表现逊于全尺寸 PLMs,且在捷径/简单样本上表现出显著过拟合,对困难样本的泛化能力差。
  • 所提出的基于不确定性的正则化方法能有效缓解对简单样本的过拟合,同时增强对困难样本的学习,从而提升整体鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。