Skip to main content
QUICK REVIEW

[论文解读] Knowledge distillation for optimization of quantized deep neural networks

Sungho Shin, Yoonho Boo|arXiv (Cornell University)|Sep 4, 2019
Advanced Neural Network Applications参考文献 40被引用 4
一句话总结

本文提出一种渐进式软损失降低(GSLR)知识蒸馏(KD)技术,用于优化量化深度神经网络(QDNNs),表明软标签分布(受温度和教师模型大小控制)比教师模型性能更为关键。该方法在CIFAR-10和CIFAR-100上实现了2-bit ResNet20的最先进精度,通过调节温度的软标签和稳健的训练调度策略(随时间逐步降低软损失),显著优于先前方法。

ABSTRACT

Knowledge distillation (KD) is a very popular method for model size reduction. Recently, the technique is exploited for quantized deep neural networks (QDNNs) training as a way to restore the performance sacrificed by word-length reduction. KD, however, employs additional hyper-parameters, such as temperature, coefficient, and the size of teacher network for QDNN training. We analyze the effect of these hyper-parameters for QDNN optimization with KD. We find that these hyper-parameters are inter-related, and also introduce a simple and effective technique that reduces extit{coefficient} during training. With KD employing the proposed hyper-parameters, we achieve the test accuracy of 92.7% and 67.0% on Resnet20 with 2-bit ternary weights for CIFAR-10 and CIFAR-100 data sets, respectively.

研究动机与目标

  • 研究教师网络选择与KD超参数对量化DNN性能的影响。
  • 确定全精度教师模型或量化教师模型在低比特网络中是否能提供更优蒸馏效果。
  • 开发一种降低KD在QDNN中对超参数调优依赖性的稳健训练策略。
  • 通过受控的软标签分布,提升2-bit量化网络在CIFAR-10和CIFAR-100上的准确率。

提出的方法

  • 采用知识蒸馏方法,学生网络使用教师网络的软标签进行训练,损失函数结合硬标签的交叉熵与软标签的损失。
  • 在softmax函数中引入温度缩放(τ),以控制教师输出分布的软度。
  • 提出渐进式软损失降低(GSLR)技术,初始阶段对硬损失与软损失赋予相等权重,并在训练过程中逐步降低软损失成分。
  • 评估多种教师模型,包括全精度、量化及知识蒸馏的教师-学生架构。
  • 分析温度、教师模型大小与损失权重(λ)之间的相互作用,以识别QDNN的最优配置。
  • 使用L2误差最小化或标准差计算1-bit或2-bit权重量化步长(Δ)。

实验结果

研究问题

  • RQ1在QDNN的知识蒸馏中,教师网络性能是否比其软标签分布的形状更为重要?
  • RQ2温度与教师模型大小如何共同影响低精度网络中的蒸馏性能?
  • RQ3若软标签分布得到恰当控制,小型教师模型是否可能超越大型模型?
  • RQ4如GSLR这类动态损失调度策略是否能降低对超参数的敏感性并提升训练鲁棒性?
  • RQ5在2-bit量化模型训练中,硬损失与软损失的最优平衡是什么?

主要发现

  • 教师模型软标签分布的形状——由温度和模型大小控制——对于有效蒸馏而言,比教师模型自身的准确率更为关键。
  • 即使小型教师网络(如ResNet20)在温度调节得当时,其性能也可与大型模型(如WRN20x2)相媲美。
  • 在CIFAR-10上,最优性能(94.8%)在τ=4且教师为WRN20x1.7时实现;在CIFAR-100上,τ=1且教师为ResNet20时表现最佳(76.8%)。
  • 当温度过高(如CIFAR-100上τ>5)时,软标签变得过度平坦,导致知识迁移减弱,准确率下降至65.49%以下。
  • GSLR技术显著提升了训练稳定性和性能,在所有教师配置下均达到或优于仅使用硬标签的训练结果。
  • 结合GSLR与恰当的超参数调优,本文在CIFAR-10上实现了2-bit ResNet20的最先进精度94.8%,在CIFAR-100上达到76.8%,超越了先前所有方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。