[论文解读] Deep geometric knowledge distillation with graphs
本文提出图知识蒸馏(GKD),一种与维度无关的知识蒸馏方法,通过使用中间特征激活的图表示来实现教师网络到学生网络的关系知识迁移。通过基于相似性的图建模样本间关系,并最小化邻接矩阵差异,GKD在视觉基准上显著提升了学生网络的准确率——相比标准RKD,准确率提升最高可达两倍,且无需匹配潜在空间维度。
In most cases deep learning architectures are trained disregarding the amount of operations and energy consumption. However, some applications, like embedded systems, can be resource-constrained during inference. A popular approach to reduce the size of a deep learning architecture consists in distilling knowledge from a bigger network (teacher) to a smaller one (student). Directly training the student to mimic the teacher representation can be effective, but it requires that both share the same latent space dimensions. In this work, we focus instead on relative knowledge distillation (RKD), which considers the geometry of the respective latent spaces, allowing for dimension-agnostic transfer of knowledge. Specifically we introduce a graph-based RKD method, in which graphs are used to capture the geometry of latent spaces. Using classical computer vision benchmarks, we demonstrate the ability of the proposed method to efficiently distillate knowledge from the teacher to the student, leading to better accuracy for the same budget as compared to existing RKD alternatives.
研究动机与目标
- 解决单个知识蒸馏(IKD)的局限性,即要求教师与学生网络在潜在空间维度上匹配。
- 通过实现与特征维度无关的知识迁移,克服分层蒸馏中的维度不匹配问题。
- 通过利用图结构更好地捕捉潜在表示中的几何关系,超越现有关系知识蒸馏(RKD)方法。
- 证明基于图的蒸馏可带来更一致且更准确的学生模型,优于标准RKD和基线方法。
提出的方法
- 构建图结构,其中节点代表训练样本,边权重编码其在特定网络层的中间特征表示之间的相似性。
- 采用k近邻方法定义局部图邻域,聚焦于最相关的样本间关系,以减少噪声影响。
- 定义教师与学生图的邻接矩阵之间的差异损失,以在训练过程中对齐其几何结构。
- 以分层方式应用基于图的蒸馏损失,实现跨不同深度、宽度或输入分辨率架构的维度无关知识迁移。
- 利用拉普拉斯矩阵的图信号平滑性分析,评估学生表示与教师几何结构的对齐程度。
- 探索不同变体,如聚焦于类间与类内配对,以及高阶邻接矩阵(p > 1),以评估方法的鲁棒性与有效性。
实验结果
研究问题
- RQ1在潜在空间中对样本间关系进行基于图的建模,是否能超越标准关系蒸馏(RKD)提升知识蒸馏性能?
- RQ2使用基于相似性的图是否能实现教师与学生网络之间有效且维度无关的蒸馏,即使其特征维度不匹配?
- RQ3与使用所有成对距离相比,通过k-NN聚焦于局部邻域或类间边距,是否能提升蒸馏性能?
- RQ4通过邻接矩阵的高阶幂获得的更高阶几何关系,在多大程度上能提升知识迁移效果,是否会引入噪声?
- RQ5通过图信号平滑性衡量,学生网络的几何结构与教师网络的对齐程度如何?
主要发现
- 当k=5时,GKD在CIFAR-100上的测试误差率为9.43%,优于基线RKD-D的9.70%,相对提升约2.8%。
- 聚焦于类间配对(不同类别)可将误差降低至9.54%,表明边缘保持比聚类对齐更具优势。
- 仅使用类内配对会使误差上升至10.35%,证实聚类相似性不如基于边缘的对齐有效。
- 降低k值(如降至5)相比更大邻域能提升性能,表明局部、高相似性关系比全局距离更具信息量。
- 高阶邻接矩阵(p=2,3)导致性能下降(误差率分别为10.44%和10.37%),表明远距离或不相关配对引入的噪声会损害知识迁移。
- 谱分析表明,GKD生成的图信号更平滑(如标签指示向量和Fiedler向量),表明其与教师潜在几何结构的对齐性更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。