[论文解读] Model Compression with Two-stage Multi-teacher Knowledge Distillation for Web Question Answering System
本文提出两阶段多教师知识蒸馏(TMKD),该方法首先在多教师蒸馏任务上预训练学生模型,然后利用多个多样化教师模型(如 BERT 和 GPT)的知识进行微调。该方法显著降低了推理延迟,同时在性能上匹配或超越教师模型,在大规模问答数据集上达到 79.22% 的准确率,甚至超过原始 BERT large 模型,同时在实际部署中实现了显著的加速效果。
Deep pre-training and fine-tuning models (such as BERT and OpenAI GPT) have demonstrated excellent results in question answering areas. However, due to the sheer amount of model parameters, the inference speed of these models is very slow. How to apply these complex models to real business scenarios becomes a challenging but practical problem. Previous model compression methods usually suffer from information loss during the model compression procedure, leading to inferior models compared with the original one. To tackle this challenge, we propose a Two-stage Multi-teacher Knowledge Distillation (TMKD for short) method for web Question Answering system. We first develop a general Q\&A distillation task for student model pre-training, and further fine-tune this pre-trained student model with multi-teacher knowledge distillation on downstream tasks (like Web Q\&A task, MNLI, SNLI, RTE tasks from GLUE), which effectively reduces the overfitting bias in individual teacher models, and transfers more general knowledge to the student model. The experiment results show that our method can significantly outperform the baseline methods and even achieve comparable results with the original teacher models, along with substantial speedup of model inference.
研究动机与目标
- 解决大型预训练模型(如 BERT、GPT)在实时网络问答系统中推理延迟过高的问题。
- 克服知识蒸馏导致的信息损失所引发的模型压缩性能下降问题。
- 通过利用来自多个教师模型的多样化、多源知识,提升学生模型的泛化能力。
- 实现在严格延迟约束(≤10ms)的生产级网络问答流水线中高效部署压缩后的模型。
- 探索训练数据规模、模型深度以及损失加权对蒸馏效果的影响。
提出的方法
- 提出两阶段训练流程:首先,使用多个教师模型输出的结果,在通用问答蒸馏任务上对学生模型进行预训练。
- 其次,利用多教师知识蒸馏(m-o-1)在下游任务(如网络问答、MNLI、SNLI 和 RTE)上对预训练的学生模型进行微调。
- 采用软标签蒸馏,损失函数结合黄金标签的交叉熵损失与来自多个教师的蒸馏损失。
- 引入动态损失加权比例 α,以平衡来自黄金标签和多个教师软标签的监督信号。
- 使用不同超参数训练的多样化教师模型(如 BERT base/large、GPT)以减少过拟合偏差并增强知识多样性。
- 采用集成蒸馏策略,每个学生模型在不同教师模型上进行训练,其预测结果进行融合以提升鲁棒性。
实验结果
研究问题
- RQ1两阶段多教师蒸馏框架是否能在学生模型准确率和推理效率方面优于单教师知识蒸馏?
- RQ2在多教师蒸馏任务上预训练学生模型,是否能提升其在下游自然语言处理任务上的泛化能力?
- RQ3学生模型中的 Transformer 层数如何影响性能与推理速度之间的权衡?
- RQ4在多教师知识蒸馏中,黄金标签监督与软标签蒸馏的最佳平衡点是什么?
- RQ5多教师蒸馏是否能超越原始教师模型的性能,特别是在大规模数据集上?
主要发现
- TMKD 在包含 0.1 亿样本的问答数据集上达到 79.22% 的准确率,超过原始 BERT large 模型(77.00%)
- 在所有评估的数据集中,该方法均优于 1-o-1 和基于平均值的多教师蒸馏(TKD base)
- 当学生模型包含 3 个 Transformer 层时,其性能与推理速度比达到最优(QPS:217),在准确率与延迟之间实现良好平衡
- 随着损失加权比例 α 增大,性能在 α = 0.9 时达到峰值,但在 α = 1.0 时性能下降,表明黄金标签监督仍具必要性
- 从 1 层增至 3 层,性能提升显著(如 QNLI 上提升 11.44%);而从 3 层增至 5 层,性能增益微乎其微(如 RTE 上仅提升 0.37%),因此 3 层为最优选择
- 该方法实现了显著的推理加速——例如,BERT large 模型延迟为 5.2ms,而压缩后的学生模型延迟约为 1.6ms,使其适用于实时网络问答系统
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。