[论文解读] Self-Knowledge Distillation in Natural Language Processing
本文提出自知识蒸馏(Self-Knowledge Distillation, SKD),一种新颖的自然语言处理知识蒸馏方法,利用训练模型自身词嵌入空间中的软目标概率——具体而言,是softmax层之前的那一层——来提升性能。通过在嵌入空间中利用向量相似度近似这些软目标,SKD增强了模型的泛化能力,减少了过拟合,并在语言建模与神经机器翻译任务中实现了稳定的性能提升。
Since deep learning became a key player in natural language processing (NLP), many deep learning models have been showing remarkable performances in a variety of NLP tasks, and in some cases, they are even outperforming humans. Such high performance can be explained by efficient knowledge representation of deep learning models. While many methods have been proposed to learn more efficient representation, knowledge distillation from pretrained deep networks suggest that we can use more information from the soft target probability to train other neural networks. In this paper, we propose a new knowledge distillation method self-knowledge distillation, based on the soft target probabilities of the training model itself, where multimode information is distilled from the word embedding space right below the softmax layer. Due to the time complexity, our method approximates the soft target probabilities. In experiments, we applied the proposed method to two different and fundamental NLP tasks: language model and neural machine translation. The experiment results show that our proposed method improves performance on the tasks.
研究动机与目标
- 通过利用训练模型自身内部知识,解决自然语言处理模型中的过拟合问题并提升泛化能力。
- 探究从模型自身词嵌入空间中提取的软目标概率是否可作为有效的知识蒸馏信号。
- 开发一种轻量级、自监督的知识蒸馏机制,无需依赖外部教师模型。
- 在语言建模与神经机器翻译等多样化自然语言处理任务中评估SKD的有效性。
- 研究SKD与数据增强技术(如噪声注入)之间的协同效应。
提出的方法
- SKD使用softmax层之前的词嵌入层作为软目标概率的来源,通过预测词嵌入与目标词嵌入之间的向量相似度来近似这些软目标。
- 该方法基于预测词向量 $ w_n $ 与目标词向量 $ w_t $ 之间的余弦相似度,定义了一种基于邻近度的软目标概率 $ q_n $,其中 $ q_n = \text{sim}(w_n, w_t) $。
- 应用温度缩放的交叉熵损失,结合标准交叉熵与蒸馏损失,以促使模型预测与内部软目标对齐。
- 蒸馏损失通过超参数 $ \alpha $ 加权,该参数在训练过程中从 0 逐渐增加至 1,以逐步引入自蒸馏信号。
- 该方法通过依赖词嵌入空间的几何结构,避免了显式软标签的计算,从而降低了计算成本。
- SKD被无缝集成到标准的语言建模与神经机器翻译训练流程中,无需修改网络架构。
实验结果
研究问题
- RQ1从模型自身词嵌入空间中提取的软目标概率是否能提升自然语言处理模型的泛化能力?
- RQ2与标准交叉熵训练相比,自知识蒸馏是否能有效减少过拟合?
- RQ3当SKD与噪声注入等数据增强技术结合时,其性能表现如何?
- RQ4SKD在语言建模与神经机器翻译等不同自然语言处理任务中是否表现出一致的性能增益?
- RQ5SKD是否可在训练过程中有效调度,以在不引起优化不稳定的情况下最大化性能?
主要发现
- SKD在所有评估的自然语言处理任务中均持续提升了BLEU分数:包括En-Fi、Fi-En与En-De翻译任务。
- 在En-Fi翻译任务中,当束搜索宽度为1时,SKD的BLEU得分为8.36(基线为7.29);当束搜索宽度为12时,BLEU得分达到9.87(基线为9.01)。
- 噪声注入与SKD的结合取得了最高性能,在En-Fi任务中束搜索宽度为12时达到10.13的BLEU得分,较基线高出0.92分。
- 代表预测词向量与目标词向量之间邻近度的 $ q_n $ 值随时间推移而增加,表明模型学习到了更准确且语义更接近的预测。
- SKD模型相比基线模型与仅使用噪声的模型表现出更慢的过拟合趋势,表明内部蒸馏信号有助于提升泛化能力。
- 在训练过程中将 $ \alpha $ 从 0 逐步增加至 1 的调度策略,有效确保了自蒸馏信号仅在模型已捕获足够初始知识后才被引入,从而避免了早期优化过程的不稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。