Skip to main content
QUICK REVIEW

[论文解读] Optimizing Prediction Serving on Low-Latency Serverless Dataflow

Vikram Sreekanti, Harikaran Subbaraj|arXiv (Cornell University)|Jul 11, 2020
Advanced Neural Network Applications参考文献 59被引用 6
一句话总结

Cloudflow 是一个无服务器数据流系统,通过在黑盒模型上应用自动、透明的优化(如算子融合和竞争执行),利用熟悉的函数式 API 优化低延迟机器学习预测服务。它在满足实时应用严格延迟要求的同时,相比最先进系统实现了高达 2 倍的性能提升。

ABSTRACT

Prediction serving systems are designed to provide large volumes of low-latency inferences machine learning models. These systems mix data processing and computationally intensive model inference and benefit from multiple heterogeneous processors and distributed computing resources. In this paper, we argue that a familiar dataflow API is well-suited to this latency-sensitive task, and amenable to optimization even with unmodified black-box ML models. We present the design of Cloudflow, a system that provides this API and realizes it on an autoscaling serverless backend. Cloudflow transparently implements performance-critical optimizations including operator fusion and competitive execution. Our evaluation shows that Cloudflow's optimizations yield significant performance improvements on synthetic workloads and that Cloudflow outperforms state-of-the-art prediction serving systems by as much as 2x on real-world prediction pipelines, meeting latency goals of demanding applications like real-time video analysis.

研究动机与目标

  • 为解决实时视频分析等交互式应用中的低延迟、高吞吐量预测服务挑战。
  • 在无需重写模型或获取白盒访问权限的情况下,实现预测管道的端到端优化。
  • 支持细粒度自动扩展和高效资源分配,以应对突发且不可预测的工作负载。
  • 提供面向开发者的友好、函数式 API,支持使用熟悉的流式操作符组合复杂预测管道。
  • 通过在黑盒模型上实现优化,弥合基于模块化微服务的系统与高度优化的白盒系统(如 Pretzel)之间的差距。

提出的方法

  • Cloudflow 使用标准操作符(如 map、filter、union)暴露一个函数式数据流 API,用于从黑盒机器学习模型组合预测管道。
  • 它运行在 Cloudburst 上,这是一个有状态的无服务器 FaaS 平台,支持低延迟状态访问和高效的函数组合。
  • 该系统自动应用数据流优化技术,如算子融合和竞争执行,以降低延迟并提高吞吐量。
  • 它利用数据流图的语义结构实现优化,而无需修改用户模型或框架。
  • Cloudflow 扩展了 Cloudburst,增加了细粒度自动扩展功能和跨异构处理器的高效数据传递机制。
  • 该系统执行透明的类型检查和被动统计监控,以提高管道正确性和可调试性。

实验结果

研究问题

  • RQ1是否可以使用熟悉的流式操作符 API 组合黑盒模型的预测管道,同时实现端到端优化?
  • RQ2自动数据流优化(如算子融合和竞争执行)在真实预测工作负载上的效果如何?
  • RQ3具备细粒度自动扩展和低延迟状态访问能力的无服务器后端,是否能超越现有预测服务系统?
  • RQ4在无需重写模型或修改机器学习框架的前提下,透明优化的适用范围有多大?
  • RQ5该系统在典型实时应用中常见的突发性交互式工作负载下表现如何?

主要发现

  • 在真实世界工作负载(如图像级联和视频处理)上,Cloudflow 相比最先进预测服务系统实现了高达 2 倍的性能提升。
  • 该系统成功满足了实时视频分析等高要求应用所需的低延迟目标,证明其适用于交互式场景。
  • 自动优化(包括算子融合和竞争执行)显著降低了端到端延迟,且无需用户干预。
  • 与 Cloudburst 的集成实现了高效、细粒度的资源分配和低延迟状态访问,这对交互式工作负载至关重要。
  • Cloudflow 的透明类型检查和被动统计监控可检测管道异常,且不会引入类型错误。
  • 在合成和真实工作负载上的评估表明,这些优化有效且广泛适用于多种预测管道模式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。