[论文解读] Normalized Feature Distillation for Semantic Segmentation
本文提出归一化特征蒸馏(NFD),一种用于语义分割的简单而有效的知识蒸馏方法,通过归一化特征响应以去除幅度信息,从而在无需人工设计知识形式的情况下,更高效地从原始特征中蒸馏知识。NFD在Cityscapes、VOC 2012和ADE20K数据集上均取得最先进性能,显著优于先前的特征蒸馏方法。
As a promising approach in model compression, knowledge distillation improves the performance of a compact model by transferring the knowledge from a cumbersome one. The kind of knowledge used to guide the training of the student is important. Previous distillation methods in semantic segmentation strive to extract various forms of knowledge from the features, which involve elaborate manual design relying on prior information and have limited performance gains. In this paper, we propose a simple yet effective feature distillation method called normalized feature distillation (NFD), aiming to enable effective distillation with the original features without the need to manually design new forms of knowledge. The key idea is to prevent the student from focusing on imitating the magnitude of the teacher's feature response by normalization. Our method achieves state-of-the-art distillation results for semantic segmentation on Cityscapes, VOC 2012, and ADE20K datasets. Code will be available.
研究动机与目标
- 为解决在语义分割中强制学生模型精确模仿教师模型特征响应时效率低下且学习困难的问题。
- 消除在特征蒸馏中依赖人工先验知识设计复杂知识形式(如注意力图、Gram矩阵)的需求。
- 通过聚焦于归一化后的特征分布,仅使用原始未修改的特征,提升蒸馏性能。
- 通过最小但高度有效的网络结构修改,实现最先进水平的蒸馏性能。
提出的方法
- NFD在计算蒸馏损失前对教师和学生网络的特征图进行归一化,去除阻碍有效知识迁移的幅度差异。
- 该方法对特征图在空间和通道维度上应用L2归一化,保留方向信息的同时舍弃幅度信息。
- 蒸馏损失基于教师和学生归一化后的特征图计算,使用标准L2损失以促进特征方向的相似性。
- 该方法对位置不敏感,且在不同蒸馏层中均表现有效,尤其在主干网络最后一层效果最佳,因该处特征更具通用性和信息量。
- 该方法无需额外模块、注意力机制或对抗性训练,轻量化且易于集成。
- 超参数敏感性分析表明,对蒸馏损失权重系数具有强鲁棒性。
实验结果
研究问题
- RQ1若不设计新的知识形式,仅通过从原始特征中去除幅度信息,能否显著提升蒸馏性能?
- RQ2为何直接蒸馏原始特征通常表现不佳?有效知识迁移的主要障碍是什么?
- RQ3对特征响应进行归一化是否能提升语义分割中教师与学生特征之间的对齐程度?
- RQ4与依赖人工设计知识形式(如成对相似性或通道概率)的现有方法相比,NFD表现如何?
- RQ5NFD在不同网络位置(如主干、解码器或最终预测层)的蒸馏效果是否存在差异?
主要发现
- 在Cityscapes数据集上,NFD将学生模型的mIoU从72.65%提升至75.86%,达到最先进性能。
- 在ADE20K数据集上,NFD将学生mIoU从35.03%提升至38.55%,展现出在不同数据集间的强泛化能力。
- NFD显著优于使用成对相似性(73.55% mIoU)、类内差异(73.90% mIoU)和通道概率(73.98% mIoU)的方法。
- 当蒸馏发生在主干网络最后一层时,NFD效果最佳,因该处特征最具通用性和信息量。
- NFD对超参数设置具有高度鲁棒性,在广泛损失权重系数范围内性能下降极小。
- 消融实验表明,通过归一化去除幅度信息,其效果优于设计复杂知识形式,即使所有方法均使用同一主干特征层。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。