[论文解读] Transferring Inductive Biases through Knowledge Distillation
本文研究知识蒸馏(KD)作为一种方法,将具有强架构归纳偏置的教师模型(如LSTM、CNN)的归纳偏置传递给归纳偏置较弱的学生模型(如Transformer、MLP)。结果表明,KD不仅提升了学生模型的性能,还使其学习到的表征和训练动态更趋近于教师模型,从而在准确率提升之外,有效传递了定性解决方案特性。
Having the right inductive biases can be crucial in many tasks or scenarios where data or computing resources are a limiting factor, or where training data is not perfectly representative of the conditions at test time. However, defining, designing and efficiently adapting inductive biases is not necessarily straightforward. In this paper, we explore the power of knowledge distillation for transferring the effect of inductive biases from one model to another. We consider families of models with different inductive biases, LSTMs vs. Transformers and CNNs vs. MLPs, in the context of tasks and scenarios where having the right inductive biases is critical. We study the effect of inductive biases on the solutions the models converge to and investigate how and to what extent the effect of inductive biases is transferred through knowledge distillation, in terms of not only performance but also different aspects of converged solutions.
研究动机与目标
- 探究知识蒸馏是否能够将教师模型的归纳偏置效应传递给架构不同的学生模型。
- 检验KD是否不仅提升性能,还使学生模型的表征学习和训练动态更趋近于教师模型,体现在表征相似性和训练路径方面。
- 评估在数据有限或分布偏移场景下(如主谓一致和损坏MNIST)归纳偏置的影响。
- 比较不同教师-学生组合(如CNN → MLP、LSTM → Transformer)的蒸馏效果,评估所传递的归纳偏置是否在学生行为中体现为定性特征。
提出的方法
- 在归纳偏置起关键作用的任务上训练教师模型(LSTM、CNN)和学生模型(Transformer、MLP):主谓一致和损坏MNIST(MNIST-C)。
- 使用教师模型的软标签(logits)进行知识蒸馏,通过温度缩放提升知识传递效果。
- 通过分析训练过程和收敛后倒数第二层激活的表征相似性,比较不同模型的解法路径和最终表征。
- 通过表征相似性的二维投影可视化训练轨迹,比较模型在优化过程中的演化方式。
- 采用多种评估指标:准确率、期望校准误差(ECE)以及不同随机种子下的方差,以评估鲁棒性和泛化能力。
- 比较不同教师-学生组合(包括自蒸馏和跨架构蒸馏)的蒸馏结果,以分离归纳偏置传递的影响。
实验结果
研究问题
- RQ1知识蒸馏能否将教师模型的归纳偏置传递给架构不同的学生模型?
- RQ2蒸馏是否不仅提升性能,还使学生模型的学习表征和训练动态更趋近于教师模型?
- RQ3从具有强归纳偏置的模型(如CNN)蒸馏,能否显著提升弱归纳偏置学生模型(如MLP)在分布外数据上的泛化能力?
- RQ4蒸馏模型的训练路径与独立训练的模型相比,在表征演化方面有何差异?
- RQ5即使学生模型无法访问教师模型的训练过程,教师的归纳偏置是否仍会影响学生模型收敛的解空间?
主要发现
- 从CNN蒸馏到MLP在翻译MNIST和缩放MNIST基准上显著提升了泛化能力,翻译MNIST错误率从0.555降至0.510,缩放MNIST错误率从0.432降至0.373。
- 当从CNN蒸馏到MLP时,MLP与CNN在缩放MNIST测试集上的性能差距几乎被消除(无KD时为0.033,KD后为0.013)。
- 表征相似性分析表明,从CNN蒸馏的MLP其学习到的表征比独立训练的MLP更接近CNN,表明归纳偏置实现了定性传递。
- 尽管未访问中间训练状态,从CNN蒸馏的MLP其训练路径与CNN教师模型更相似,表明优化轨迹的趋同。
- 自蒸馏仅带来微小改进,而从CNN到MLP的蒸馏显著提升了性能并降低了方差,凸显了架构归纳偏置在知识传递中的关键作用。
- 从LSTM到Transformer的蒸馏提升了后者在主谓一致任务上的性能,并使其解法更接近LSTM,证实了循环归纳偏置的有效传递。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。