Skip to main content
QUICK REVIEW

[论文解读] XtremeDistilTransformers: Task Transfer for Task-agnostic Distillation

Subhabrata Mukherjee, Ahmed Hassan Awadallah|arXiv (Cornell University)|Jun 8, 2021
Topic Modeling参考文献 36被引用 8
一句话总结

XtremeDistilTransformers 提出了一种任务无关的蒸馏框架,通过利用高性能源任务(尤其是自然语言蕴涵,NLI)中的任务特定知识,训练一个紧凑且通用的学生模型。通过在多个层间转移大型教师模型的深层表征和注意力状态,并结合任务特定的数据增强,该方法在 41 种语言的命名实体识别基准上实现了 87 倍的编码器压缩,仅带来与 mBERT 相比 5.07% 的 F1 分数差距。

ABSTRACT

While deep and large pre-trained models are the state-of-the-art for various natural language processing tasks, their huge size poses significant challenges for practical uses in resource constrained settings. Recent works in knowledge distillation propose task-agnostic as well as task-specific methods to compress these models, with task-specific ones often yielding higher compression rate. In this work, we develop a new task-agnostic distillation framework XtremeDistilTransformers that leverages the advantage of task-specific methods for learning a small universal model that can be applied to arbitrary tasks and languages. To this end, we study the transferability of several source tasks, augmentation resources and model architecture for distillation. We evaluate our model performance on multiple tasks, including the General Language Understanding Evaluation (GLUE) benchmark, SQuAD question answering dataset and a massive multi-lingual NER dataset with 41 languages. We release three distilled task-agnostic checkpoints with 13MM, 22MM and 33MM parameters obtaining SOTA performance in several tasks.

研究动机与目标

  • 通过结合任务特定与任务无关的方法,解决蒸馏中模型压缩与泛化能力之间的权衡。
  • 识别能最大化向多样化下游任务和语言迁移能力的最优源任务及数据增强策略。
  • 开发一种蒸馏框架,实现从大型教师模型到紧凑、通用学生模型的渐进式知识迁移。
  • 实现与任务特定蒸馏相当的高比例压缩率,同时保持在各类任务和语言上的广泛适用性。
  • 公开发布任务无关的蒸馏模型检查点,支持在低资源和边缘环境中的部署。

提出的方法

  • 基于对下游任务的迁移能力,选择高性能的源任务(如 MNLI、QNLI、SST-2),其中 NLI 展现出最强的泛化能力。
  • 使用任务特定微调的教师模型生成软标签以及中间表征(注意力状态和隐藏状态)用于蒸馏。
  • 在教师模型和学生模型的多个层之间实施渐进式知识蒸馏,同时迁移表征知识和注意力知识。
  • 通过回译和自训练实现多语言数据增强,以提升在 41 种语言上的泛化能力和鲁棒性。
  • 冻结并从教师模型向学生模型迁移多语言词嵌入和编码器参数,提升训练稳定性和性能。
  • 端到端训练学生模型,蒸馏目标包括来自软标签和中间层特征的知识蒸馏。

实验结果

研究问题

  • RQ1哪些源任务能为在多样化自然语言处理任务上蒸馏出通用、任务无关的学生模型提供最佳迁移能力?
  • RQ2在多语言设置下,引入任务特定的数据增强如何提升蒸馏模型的性能与泛化能力?
  • RQ3与单层蒸馏或仅表征蒸馏相比,从教师模型的多层进行蒸馏在多大程度上能提升学生模型的性能?
  • RQ4模型架构的选择(如层数、注意力头数量、隐藏层维度)如何影响压缩率与准确率之间的权衡?
  • RQ5一个单一蒸馏模型是否能在无需任务特定微调的情况下,同时在多样化任务和语言上实现高性能,且保持高比例压缩?

主要发现

  • NLI 任务(特别是 MNLI)展现出最强的迁移能力,在下游任务上平均微调性能达到 87.8,优于其他源任务。
  • XtremeDistilTransformers 在 41 种语言的命名实体识别基准上实现了高达 87 倍的编码器压缩(从 87M 参数压缩至 1M 参数),仅带来与 mBERT 相比 5.07% 的 F1 分数差距。
  • 最小模型变体(6 层、12 个注意力头、384 个隐藏层维度)在命名实体识别任务上达到 88.00 的 F1 分数,实现 8 倍压缩,且性能差距为 5.07%。
  • 移除多层注意力蒸馏(消融实验 a)导致 F1 分数下降 1.52 分,凸显深层知识迁移的重要性。
  • 使用单语词嵌入(消融实验 c)导致 F1 分数下降 10.48 分,证明多语言嵌入迁移的关键作用。
  • 从随机初始化开始训练且不进行参数迁移(消融实验 e)导致 F1 分数下降 9.3 分,证实知识迁移在蒸馏中的显著优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。