Skip to main content
QUICK REVIEW

[论文解读] Cross-Image Relational Knowledge Distillation for Semantic Segmentation

Chuanguang Yang, Helong Zhou|arXiv (Cornell University)|Apr 14, 2022
Advanced Neural Network Applications被引用 9
一句话总结

该论文提出了一种新型知识蒸馏框架——跨图像关系知识蒸馏(CIRKD),用于语义分割任务,通过在教师网络与学生网络之间迁移多张图像间的全局像素-像素关系和像素-区域关系,实现知识迁移。通过利用包含像素队列和区域队列的记忆库来建模长距离依赖关系,CIRKD 在性能上超越了当前最先进方法,在 Cityscapes 数据集上达到 75.42% 的 mIoU,分别在 DeepLabV3 和 PSPNet 上较 Channel-Wise KD 提升 0.48% 和 0.79%。

ABSTRACT

Current Knowledge Distillation (KD) methods for semantic segmentation often guide the student to mimic the teacher's structured information generated from individual data samples. However, they ignore the global semantic relations among pixels across various images that are valuable for KD. This paper proposes a novel Cross-Image Relational KD (CIRKD), which focuses on transferring structured pixel-to-pixel and pixel-to-region relations among the whole images. The motivation is that a good teacher network could construct a well-structured feature space in terms of global pixel dependencies. CIRKD makes the student mimic better structured semantic relations from the teacher, thus improving the segmentation performance. Experimental results over Cityscapes, CamVid and Pascal VOC datasets demonstrate the effectiveness of our proposed approach against state-of-the-art distillation methods. The code is available at https://github.com/winycg/CIRKD.

研究动机与目标

  • 为解决现有语义分割知识蒸馏方法的局限性,即仅关注图像内部关系而忽略跨图像语义依赖。
  • 通过在多样化的训练图像间迁移结构化、全局的像素级关系与像素-区域关系,提升学生网络的性能。
  • 利用冻结教师网络的记忆库建模长距离像素依赖,实现更鲁棒且泛化能力更强的知识迁移。
  • 证明全局关系知识(超越局部或通道级特征)在密集预测任务中显著提升蒸馏的有效性。

提出的方法

  • CIRKD 在记忆库中构建像素队列和区域队列,用于存储预训练教师网络的冻结特征嵌入,从而能够访问当前小批量之外大量图像的嵌入特征。
  • 通过 KL 散度对齐当前小批量中的锚点与从像素队列中采样的对比嵌入之间的相似度分布,实现像素-像素蒸馏。
  • 引入像素-区域蒸馏,用于迁移单个像素与类别原型(区域嵌入)之间的相对相似度,增强类别级别的语义理解。
  • 区域嵌入通过特征图中同一语义类别所有像素嵌入的平均池化计算得到。
  • 采用温度缩放策略以平滑蒸馏过程中的相似度分布,实验发现 τ = 0.1 时性能最优。
  • 最终损失函数结合了任务损失、标准 KD 损失以及两项新颖的关系蒸馏损失:$L_{memory\_p2p}$ 和 $L_{memory\_p2r}$,并采用 KL 散度从学生网络到教师网络进行训练。

实验结果

研究问题

  • RQ1在语义分割中,仅迁移全局跨图像像素关系是否能超越图像内关系,提升知识蒸馏性能?
  • RQ2通过冻结嵌入的记忆库建模长距离依赖关系,如何影响学生网络的泛化能力与性能表现?
  • RQ3在密集预测任务中,像素-像素关系与像素-区域关系知识的相对贡献分别是什么?
  • RQ4超参数如队列大小、温度系数及对比样本数量如何影响蒸馏性能?

主要发现

  • CIRKD 在 Cityscapes 验证集上达到 75.42% 的 mIoU,学生与教师之间的性能差距由 4.95% 降低至 2.65%。
  • 在 DeepLabV3 上较 Channel-Wise KD(CWD)提升 0.48% mIoU,在 PSPNet 上提升 0.79% mIoU,证明其在当前最先进蒸馏方法中的优越性。
  • 基于记忆的像素-像素蒸馏($L_{memory\_p2p}$)相比标准 KD 提升 0.85% mIoU,表明更大嵌入池带来的更广泛上下文信息具有显著优势。
  • 消融实验证实,像素-像素蒸馏比像素-区域蒸馏更具信息量,且更大的队列大小与更多对比样本数量可提升性能,直至达到饱和点。
  • 最优性能在 τ = 0.1、$K_p = 4096$ 个对比像素嵌入与 $K_r = 1024$ 个对比区域嵌入下实现,表明高维相似度分布能捕捉更丰富的依赖关系。
  • 该方法在不同学生网络架构(如 DeepLabV3-MobileNetV2 和 PSPNet-Res18)上均表现出良好可扩展性,展现出强大的泛化能力与适应性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。