[论文解读] Why Skip If You Can Combine: A Simple Knowledge Distillation Technique for Intermediate Layers
本文提出了一种新颖的知识蒸馏技术——组合知识蒸馏(Combinatorial Knowledge Distillation, CKD),通过将深层教师网络的中间层特征组合到紧凑的学生网络中,避免跳过任何层,解决了现有方法中的“跳过问题”。CKD 在参数量减少 50% 的情况下实现了最先进性能,其在低资源神经机器翻译任务上的翻译质量与 12 层教师模型相当。
With the growth of computing power neural machine translation (NMT) models also grow accordingly and become better. However, they also become harder to deploy on edge devices due to memory constraints. To cope with this problem, a common practice is to distill knowledge from a large and accurately-trained teacher network (T) into a compact student network (S). Although knowledge distillation (KD) is useful in most cases, our study shows that existing KD techniques might not be suitable enough for deep NMT engines, so we propose a novel alternative. In our model, besides matching T and S predictions we have a combinatorial mechanism to inject layer-level supervision from T to S. In this paper, we target low-resource settings and evaluate our translation engines for Portuguese--English, Turkish--English, and English--German directions. Students trained using our technique have 50% fewer parameters and can still deliver comparable results to those of 12-layer teachers.
研究动机与目标
- 解决知识蒸馏中的‘跳过问题’,即由于架构不匹配,深层教师模型的中间层无法与浅层学生模型对应。
- 通过利用最终预测结果以及中间层表示,改进神经机器翻译中的知识蒸馏。
- 开发一种方法,实现对教师模型所有层的完整利用,无需选择性剪枝或跳过,从而提升学生模型性能。
- 通过一种新颖的组合机制,验证将中间层特征拼接用于蒸馏的效果。
- 在低资源神经机器翻译设置下验证该方法的有效性,表明紧凑的学生模型可达到大型教师模型的性能。
提出的方法
- 提出一种组合机制,将教师网络多个编码器层的中间层特征拼接为单一表示用于蒸馏。
- 引入一种新的损失函数,结合标准交叉熵损失(硬损失)、标准知识蒸馏损失(软损失)以及一种新的中间层蒸馏损失。
- 中间层损失将多个教师编码器层的拼接输出与对应的学生编码器层输出进行匹配。
- 采用损失的加权组合:总损失 = β×hard_loss + η×soft_loss + λ×intermediate_loss,其中 λ=0.7 且 η=0.1,通过超参数搜索进行优化。
- 仅在编码器端应用蒸馏,保持解码器层与教师模型无连接,以避免性能下降。
- 采用基于多头注意力机制的架构并引入残差连接,训练具有 4 个编码器层的学生模型,对应 12 层教师模型。
实验结果
研究问题
- RQ1一种结合深层教师模型多个中间层特征的知识蒸馏方法,是否能优于现有跳过层的方法?
- RQ2与逐层匹配或仅基于预测的蒸馏相比,中间表示的组合融合是否能提升学生模型性能?
- RQ3在低资源神经机器翻译设置下,参数量减少 50% 的紧凑学生模型是否能匹配 12 层教师模型的翻译质量?
- RQ4与 PKD 等现有技术相比,该方法在大规模神经机器翻译数据集上的表现如何?
- RQ5通过组合中间层带来的性能提升是否在统计上显著且在不同语言方向上具有鲁棒性?
主要发现
- 在葡萄牙语到英语的翻译任务中,CKD 达到 43.78 的 BLEU 分数,优于 PKD(43.28)和原始 RKD 基线。
- 在英语到德语的翻译任务中,CKD 达到 24.14 的 BLEU 分数,超过 PKD(23.38)和 No-KD(24.31),表明在各类任务中均具有一致性优势。
- 在英语到法语的翻译任务中,CKD 达到 36.10 的 BLEU 分数,超过 No-KD(35.45)和 PKD(34.97),证实其在大规模数据集上的有效性。
- 该方法使学生模型的参数量减少 50% 仍能匹配 12 层教师模型的性能,验证了模型的高效性。
- 实验表明,即使在 PKD 中匹配自注意力组件可略微提升性能,CKD 仍优于这些增强后的变体。
- 中间层损失赋予较高权重(λ=0.7),表明其在训练高质量紧凑模型中起着关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。