Skip to main content
QUICK REVIEW

[论文解读] Accelerating Deep Learning Inference via Learned Caches

Arjun Balasubramanian, Adarsh Kumar|arXiv (Cornell University)|Jan 18, 2021
Advanced Neural Network Applications参考文献 67被引用 7
一句话总结

本文提出 Gati,一种深度学习推理系统,通过使用学习型缓存(即预测中间 DNN 层缓存命中与输出的机器学习模型)来加速预测延迟。通过基于缓存结果动态跳过计算并采用增量重规划,Gati 在不损失模型准确率的前提下,将平均推理延迟降低高达 7.69 倍,同时将端到端准确率提升最高 1%。

ABSTRACT

Deep Neural Networks (DNNs) are witnessing increased adoption in multiple domains owing to their high accuracy in solving real-world problems. However, this high accuracy has been achieved by building deeper networks, posing a fundamental challenge to the low latency inference desired by user-facing applications. Current low latency solutions trade-off on accuracy or fail to exploit the inherent temporal locality in prediction serving workloads. We observe that caching hidden layer outputs of the DNN can introduce a form of late-binding where inference requests only consume the amount of computation needed. This enables a mechanism for achieving low latencies, coupled with an ability to exploit temporal locality. However, traditional caching approaches incur high memory overheads and lookup latencies, leading us to design learned caches - caches that consist of simple ML models that are continuously updated. We present the design of GATI, an end-to-end prediction serving system that incorporates learned caches for low-latency DNN inference. Results show that GATI can reduce inference latency by up to 7.69X on realistic workloads.

研究动机与目标

  • 解决由于模型深度和复杂性增加而带来的深度神经网络(DNN)推理延迟增长问题。
  • 利用面向用户预测工作负载中的时间局部性,使频繁出现的输入能够更快响应。
  • 实现在推理时延迟绑定计算——即在推理时才选择模型复杂度——而不牺牲准确率。
  • 通过用轻量级机器学习模型替代原始特征存储,降低传统 DNN 缓存的内存和查找开销。
  • 设计一种系统,自动选择最优层和架构用于学习型缓存,在资源约束下最小化延迟。

提出的方法

  • Gati 在每层使用两个学习神经网络:一个预测网络用于估计最终输出,一个选择网络用于判断该预测是否可作为缓存命中使用。
  • 系统使用验证数据集进行初始离线调优,以估算命中率和准确率,从而选择最优的缓存层位置和模型架构。
  • 在推理过程中,Gati 在每层后检查缓存命中;若命中,则跳过后续层,从而减少计算量。
  • 系统支持在模型 DAG 上进行查询规划,可根据延迟 SLO 和输入特征动态选择 DNN。
  • Gati 在运行时采用增量重规划,根据工作负载变化动态调整模型选择,同时提升延迟与准确率。
  • 学习型缓存机制被集成到端到端服务系统中,可在保持完整准确率的同时加速简单输入的处理。

实验结果

研究问题

  • RQ1学习型缓存(即预测中间 DNN 输出和缓存命中的机器学习模型)是否能在不损失准确率的前提下降低推理延迟?
  • RQ2如何利用现实世界预测工作负载中的时间局部性来加速 DNN 推理?
  • RQ3延迟绑定计算(即在推理时选择模型深度)在多大程度上能降低平均延迟?
  • RQ4增量重规划能否在动态预测工作负载中同时提升延迟与准确率?
  • RQ5在部署学习型缓存时,内存、计算与延迟之间的最优权衡是什么?

主要发现

  • 通过利用学习型缓存与动态模型选择,Gati 在真实工作负载上将平均推理延迟降低高达 7.69 倍。
  • 通过增量重规划,系统将端到端准确率最高提升 1%,使更准确的模型可用于频繁出现的输入。
  • 在严格的延迟 SLO(≤100 ms)下,由于缓存命中的延迟节省,Gati 使约 79% 的请求可使用更准确的模型(如用于人脸的 SE-LResNet50E-IR)和约 80% 的请求可使用更准确的模型(如用于车辆的 ResNet-50)。
  • 与传统缓存相比,学习型缓存通过使用紧凑的机器学习模型替代高维特征图存储,显著降低了内存开销和查找延迟。
  • Gati 的增量重规划机制可动态适应工作负载变化,实现延迟与准确率的同步提升。
  • 实验表明,学习型缓存可与现有技术(如模型级联)互补,在不损失准确率的前提下提供额外的延迟收益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。