[论文解读] InferLine: ML Prediction Pipeline Provisioning and Management for Tight Latency Objectives
InferLine 是一个自动化系统,用于配置和管理多阶段机器学习推理流水线,以在最低成本下满足严格的端到端尾部延迟服务等级目标(SLO)。它结合了基于性能分析和离散事件仿真的低频组合规划器,以及基于网络微积分的高频自动伸缩调优器,以动态响应工作负载变化,从而将成本降低高达 7.6 倍,SLO 违约率降低 34.5 倍,优于以往方法。
Serving ML prediction pipelines spanning multiple models and hardware accelerators is a key challenge in production machine learning. Optimally configuring these pipelines to meet tight end-to-end latency goals is complicated by the interaction between model batch size, the choice of hardware accelerator, and variation in the query arrival process. In this paper we introduce InferLine, a system which provisions and manages the individual stages of prediction pipelines to meet end-to-end tail latency constraints while minimizing cost. InferLine consists of a low-frequency combinatorial planner and a high-frequency auto-scaling tuner. The low-frequency planner leverages stage-wise profiling, discrete event simulation, and constrained combinatorial search to automatically select hardware type, replication, and batching parameters for each stage in the pipeline. The high-frequency tuner uses network calculus to auto-scale each stage to meet tail latency goals in response to changes in the query arrival process. We demonstrate that InferLine outperforms existing approaches by up to 7.6x in cost while achieving up to 34.5x lower latency SLO miss rate on realistic workloads and generalizes across state-of-the-art model serving frameworks.
研究动机与目标
- 解决在严格端到端尾部延迟约束下配置和管理复杂多模型机器学习推理流水线的挑战。
- 在确保端到端延迟符合应用指定服务等级目标(SLO)的前提下,最小化运行成本。
- 自动化选择硬件加速器、批处理大小和各流水线阶段的复制级别,减轻手动调优负担。
- 在不拒绝请求的情况下,动态适应突发性和可变的查询工作负载,确保在实时流量变化下仍符合 SLO。
- 适用于最先进的模型服务框架(如 TensorFlow Serving 和 Clipper),支持广泛部署。
提出的方法
- 低频规划器使用阶段级性能分析和离散事件仿真,建模不同配置下的端到端流水线延迟。
- 通过受约束的组合优化,寻找在满足端到端尾部延迟 SLO 条件下成本最低的配置。
- 高频调优器使用网络微积分,在多个时间尺度上建模流量包络,并检测工作负载变化。
- 根据查询到达模式的变化,动态自动伸缩各个流水线阶段,确保 SLO 遵循且不拒绝请求。
- 通过作为配置和编排层集成到现有服务框架中,而非替代推理引擎,实现系统集成。
- 利用机器学习推理的确定性和无副作用特性,从单个模型性能分析中估算流水线性能。
实验结果
研究问题
- RQ1如何自动配置多阶段机器学习推理流水线,在最小化成本的同时满足端到端尾部延迟 SLO?
- RQ2在不同工作负载下,流水线中每个阶段的最优硬件加速器、批处理大小和复制级别组合是什么?
- RQ3如何实现实时动态调整流水线配置,以应对瞬时查询峰值而不违反延迟 SLO?
- RQ4基于仿真和网络微积分的规划器-调优器架构是否能优于现有的静态或粗粒度自动伸缩方法,在成本和 SLO 遵循性方面表现更优?
- RQ5该系统在不同模型类型、输入特征和推理框架之间是否具备良好的泛化能力?
主要发现
- 与基线配置策略相比,InferLine 将成本降低高达 7.6 倍,同时保持或提升 SLO 遵循性。
- 在真实工作负载下,与现有方法相比,InferLine 的延迟 SLO 违约率降低了 34.5 倍。
- InferLine 实现了超过 99% 的 SLO 遵循率,是文献中报告的此类系统中最高的水平。
- 高频调优器在延迟 SLO 遵循性和成本效率方面均优于粗粒度自动伸缩基线方法。
- 规划器基于仿真的方法能够准确预测端到端延迟,而无需实际部署流水线。
- 该系统在多种流水线中表现出良好的泛化能力,包括图像处理、视频监控、社交媒体和 TF Cascade 等,展现出广泛的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。