Skip to main content
QUICK REVIEW

[论文解读] Accelerating Deep Learning Inference via Freezing

Adarsh Kumar, Arjun Balasubramanian|arXiv (Cornell University)|Feb 7, 2020
Advanced Neural Network Applications被引用 4
一句话总结

该论文提出 Freeze Inference,一种通过使用 k-means 聚类缓存中间层激活以实现近似、低延迟推理的系统,从而加速深度学习推理。该方法在 ResNet-18 上对 91.58% 的 CIFAR-10 请求将有效计算量减少了高达 50%,仅使用 12.5MB 缓存内存即实现了 92.85% 的准确率。

ABSTRACT

Over the last few years, Deep Neural Networks (DNNs) have become ubiquitous owing to their high accuracy on real-world tasks. However, this increase in accuracy comes at the cost of computationally expensive models leading to higher prediction latencies. Prior efforts to reduce this latency such as quantization, model distillation, and any-time prediction models typically trade-off accuracy for performance. In this work, we observe that caching intermediate layer outputs can help us avoid running all the layers of a DNN for a sizeable fraction of inference requests. We find that this can potentially reduce the number of effective layers by half for 91.58% of CIFAR-10 requests run on ResNet-18. We present Freeze Inference, a system that introduces approximate caching at each intermediate layer and we discuss techniques to reduce the cache size and improve the cache hit rate. Finally, we discuss some of the open research challenges in realizing such a design.

研究动机与目标

  • 解决由于模型日益复杂和准确而导致的深度神经网络(DNNs)推理延迟增加的问题。
  • 在不牺牲模型准确率的前提下降低预测延迟,与量化或蒸馏等先前方法不同。
  • 探索缓存中间层输出的可行性,以避免对大量推理请求执行完整的前向传播。
  • 设计一种可扩展、低内存的缓存系统,通过近似匹配实现快速查找并保持高准确率。
  • 实现在具有动态批处理和增量更新的现实世界 DNN 服务系统中缓存的实用化部署。

提出的方法

  • 利用训练数据中的中间层输出构建离线缓存,通过降维技术压缩高维张量。
  • 在降维后的空间上应用 k-means 聚类,仅存储聚类中心,以最小化内存占用。
  • 使用 k-最近邻(k-NN)搜索将新输入与最近的聚类中心匹配,实现快速缓存查找。
  • 引入置信度阈值,以判断基于缓存中心的预测是否足够可靠,从而决定是否跳过后续层。
  • 通过将距离计算卸载到 CPU 来优化缓存查找性能,相比单个 DNN 层的计算速度提升约 20 倍。
  • 设计一种支持动态批处理和增量缓存更新的系统,以适应随时间出现的新频繁输入。

实验结果

研究问题

  • RQ1DNN 中的中间层输出能否被有效缓存,从而避免对大量推理请求执行完整的前向传播?
  • RQ2如何设计近似缓存机制,以在内存使用、查找速度和预测准确率之间取得平衡?
  • RQ3特定层的聚类与阈值设置对延迟降低与准确率之间权衡的影响是什么?
  • RQ4如何将缓存集成到具有动态批处理的 GPU 推理流水线中?
  • RQ5哪些机制能够实现在不重新训练整个模型的前提下进行增量、在线缓存更新?

主要发现

  • 通过中间层缓存,Freeze Inference 在 ResNet-18 上对 91.58% 的 CIFAR-10 请求将有效层数减少了高达 50%。
  • 当基于缓存中心冻结预测时,系统在 CIFAR-10 上达到 92.85% 的准确率,在 CIFAR-100 上达到 88.86% 的准确率。
  • 缓存查找速度约为计算单个 DNN 层的 20 倍,实现了低延迟推理。
  • ResNet-18 的最终缓存仅需 12.5MB 内存,通过 k-means 聚类实现了极高的内存效率。
  • 通过阈值参数可调节冻结请求比例与准确率之间的权衡,更高的阈值可提升准确率,但会减少可冻结的请求数量。
  • 该方法在实际部署中展现出强大潜力,尤其在非均匀请求工作负载下;然而,动态批处理和在线更新仍是待解决的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。