Skip to main content
QUICK REVIEW

[论文解读] In Teacher We Trust: Learning Compressed Models for Pedestrian Detection

Jonathan Shen, Noranart Vesdapunt|arXiv (Cornell University)|Dec 1, 2016
Advanced Neural Network Applications参考文献 4被引用 21
一句话总结

该论文提出了一种知识蒸馏框架,通过利用高维提示层、基于教师网络置信度的不确定性感知损失,以及手工设计的ACF特征,将大型行人检测模型压缩为小型高效的学生网络。该方法在Caltech数据集上实现了400倍的参数压缩——仅157K参数,同时优于参数量为5700万的AlexNet,推理速度提升8倍,内存使用降低21倍。

ABSTRACT

Deep convolutional neural networks continue to advance the state-of-the-art in many domains as they grow bigger and more complex. It has been observed that many of the parameters of a large network are redundant, allowing for the possibility of learning a smaller network that mimics the outputs of the large network through a process called Knowledge Distillation. We show, however, that standard Knowledge Distillation is not effective for learning small models for the task of pedestrian detection. To improve this process, we introduce a higher-dimensional hint layer to increase information flow. We also estimate the variance in the outputs of the large network and propose a loss function to incorporate this uncertainty. Finally, we attempt to boost the complexity of the small network without increasing its size by using as input hand-designed features that have been demonstrated to be effective for pedestrian detection. We succeed in training a model that contains $400 imes$ fewer parameters than the large network while outperforming AlexNet on the Caltech Pedestrian Dataset.

研究动机与目标

  • 解决标准知识蒸馏在行人检测中因输出维度较低(二分类)而导致的效率低下问题。
  • 在不牺牲准确率的前提下,减小模型尺寸和推理成本,以实现实时行人检测。
  • 通过引入教师网络的不确定性估计,改进知识蒸馏效果。
  • 探究尽管深度学习具备特征学习能力,手工设计的特征(如ACF)是否仍能增强小型学生网络的性能。
  • 证明紧凑的学生模型可在参数量远小于AlexNet的情况下实现超越其性能,同时显著更小、更快。

提出的方法

  • 在教师网络的最终层之前引入一个全连接提示层,以提高蒸馏过程中的输出维度。
  • 通过在测试时应用Dropout来估计教师网络预测的方差,以建模预测不确定性。
  • 设计一种新型损失函数,将教师网络预测的协方差信息融入其中,以提升学生网络的学习效果。
  • 将聚合通道特征(ACF)作为学生网络的输入,以在不增加模型大小的前提下提升性能。
  • 使用软标签(来自教师网络)、提示层输出以及不确定性感知损失联合训练学生网络。
  • 采用多种变体进行知识蒸馏:标准KD、带提示的KD、带置信度的KD,以及同时结合提示和置信度的KD。

实验结果

研究问题

  • RQ1在分类任务为二分类的背景下,标准知识蒸馏能否有效压缩大型行人检测模型?
  • RQ2引入高维提示层是否能提升行人检测中知识蒸馏的性能?
  • RQ3在教师网络中建模预测不确定性是否能带来更好的学生网络泛化能力?
  • RQ4手工设计的特征(如ACF)是否能提升小型学生网络在行人检测中的性能?
  • RQ5一个参数量仅为教师网络1/400的学生网络是否能超越AlexNet等更大模型?

主要发现

  • 所提方法结合提示层与不确定性感知损失,在Caltech数据集上将对数平均漏检率降低至18.0%,优于标准KD和从零开始训练的基线。
  • 仅含157,000个参数的学生模型在对数平均漏检率上比教师网络(6300万个参数)低4.9%,表明压缩过程带来了显著的性能增益。
  • 在Titan X GPU上,学生模型的推理速度比教师网络快8倍(3ms vs. 24ms),内存占用降低21倍(240MB vs. 5.05GB)。
  • 同时结合提示层与不确定性建模的方案表现最佳,使最小模型的漏检率降至22.4%,而标准KD为25.2%。
  • 在提示层与置信度模块中引入ACF特征可提升学生模型性能,但使用RGB输入的模型仍优于基于ACF的模型,表明RGB特征在深度学习中仍具优势。
  • 学生模型在保持或提升准确率的同时实现了8倍加速和21倍内存减少,证明参数效率并不需要以性能为代价。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。