[论文解读] Learning Deep Representations with Probabilistic Knowledge Transfer
本文提出概率知识迁移(Probabilistic Knowledge Transfer, PKT),一种新颖的知识蒸馏方法,通过匹配特征空间中数据的概率分布来传递知识,而非回归教师模型的输出。PKT 在多种任务中表现优于现有方法,包括从手工设计特征迁移、跨模态迁移(文本到视觉)以及从目标检测器迁移知识,在 PASCAL VOC 2007 和 VOC 2012 上取得了当前最优结果。
Knowledge Transfer (KT) techniques tackle the problem of transferring the knowledge from a large and complex neural network into a smaller and faster one. However, existing KT methods are tailored towards classification tasks and they cannot be used efficiently for other representation learning tasks. In this paper a novel knowledge transfer technique, that is capable of training a student model that maintains the same amount of mutual information between the learned representation and a set of (possible unknown) labels as the teacher model, is proposed. Apart from outperforming existing KT techniques, the proposed method allows for overcoming several limitations of existing methods providing new insight into KT as well as novel KT applications, ranging from knowledge transfer from handcrafted feature extractors to {cross-modal} KT from the textual modality into the representation extracted from the visual modality of the data.
研究动机与目标
- 解决现有知识迁移(KT)方法的局限性,这些方法主要针对分类任务设计,难以泛化到表示学习任务。
- 克服当前KT技术在不同架构或维度模型之间迁移知识的能力不足,尤其在非分类场景中的局限。
- 实现从手工设计特征提取器(如 SIFT、HoG)向深度神经网络的有效知识迁移,以利用未标注数据并减少对大规模标注数据集的依赖。
- 促进跨模态知识迁移,例如将文本属性的知识迁移到视觉特征提取器,提升多模态学习性能。
- 实现从强大目标检测器(如 YOLOv2)到更小、轻量级检测器(如 Tiny YOLO)的直接知识迁移,提升精度且无需 ImageNet 预训练。
提出的方法
- 使用高斯核将特征空间中数据样本之间的相互作用建模为概率分布,以表达成对亲和性。
- 将知识迁移形式化为最小化教师与学生网络在特征空间中的概率分布之间的 Kullback-Leibler(KL)散度。
- 训练学生网络以匹配教师特征表示的概率分布,而非回归教师输出的 logits。
- 通过聚焦于中间特征表示而非最终分类层,实现在不同架构和模态间的应用。
- 采用对称 KL 散度以提升稳定性,并确保方法在教师与学生具有不同层维度或网络结构时仍适用。
- 通过将非深度模型(如 HoG)的特征空间建模为概率分布,并与学生分布匹配,实现从非深度模型的迁移。
实验结果
研究问题
- RQ1现有知识迁移技术能否有效应用于超越分类任务的表示学习任务?
- RQ2通过直接建模并匹配教师特征空间的几何结构(如流形和局部相似性),能否提升知识迁移效果?
- RQ3是否可行将手工设计特征提取器(如 SIFT、HoG)的知识迁移到深度神经网络中,以在标注数据有限的情况下提升性能?
- RQ4能否在模态之间实现有效知识迁移,例如从文本属性迁移到视觉表征?
- RQ5能否实现从强大目标检测器(如 YOLOv2)到更小、轻量级检测器(如 Tiny YOLO)的直接知识迁移,从而避免 ImageNet 预训练?
主要发现
- 在将 2×2 HoG 特征的知识迁移到学生网络时,PKT 在 PASCAL VOC 2007 上达到 26.84% 的 mAP,显著优于基于提示的方法(16.40% mAP)。
- 在从文本属性到视觉特征的跨模态知识迁移中,PKT 相较于基线提示方法实现了超过 80% 的 mAP 相对提升。
- 在 PASCAL VOC 2007 上,PKT 在目标检测任务中达到 44.14% 的 mAP,优于随机初始化模型(18.39% mAP)和 ImageNet 预训练基线(38.02% mAP)。
- PKT 实现了从 YOLOv2 目标检测器(第 29 层)到更小的 Tiny YOLO 模型(第 13 层)的知识直接迁移,在无需 ImageNet 预训练的情况下实现了更优性能。
- 该方法在多种设置下表现出鲁棒性,包括从手工特征迁移、跨模态迁移以及目标检测器之间的迁移,始终优于现有 KT 技术。
- 通过概率分布建模特征空间的内在几何结构,PKT 比基于输出的蒸馏方法更有效地保留了局部结构和相似性关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。