Skip to main content
QUICK REVIEW

[论文解读] Scalable Deployment of AI Time-series Models for IoT

Bradley Eck, Francesco Fusco|arXiv (Cornell University)|Mar 24, 2020
Time Series Analysis and Forecasting参考文献 8被引用 5
一句话总结

本文介绍了IBM Research Castor,一个为物联网应用中可扩展的AI时间序列模型部署而设计的云原生系统。它通过无服务器计算和语义知识图谱,实现了数千个模型的自动化、并行执行,平均推理延迟低于20秒,每小时可支持27,600个模型评分任务,同时支持175个并行执行。

ABSTRACT

IBM Research Castor, a cloud-native system for managing and deploying large numbers of AI time-series models in IoT applications, is described. Modelling code templates, in Python and R, following a typical machine-learning workflow are supported. A knowledge-based approach to managing model and time-series data allows the use of general semantic concepts for expressing feature engineering tasks. Model templates can be programmatically deployed against specific instances of semantic concepts, thus supporting model reuse and automated replication as the IoT application grows. Deployed models are automatically executed in parallel leveraging a serverless cloud computing framework. The complete history of trained model versions and rolling-horizon predictions is persisted, thus enabling full model lineage and traceability. Results from deployments in real-world smart-grid live forecasting applications are reported. Scalability of executing up to tens of thousands of AI modelling tasks is also evaluated.

研究动机与目标

  • 解决在大规模物联网系统中手动部署和管理数千个AI时间序列模型的挑战。
  • 通过无服务器云计算,实现AI模型的自动化、可扩展执行。
  • 通过时间序列数据和模型模板的语义建模,支持模型重用和自动化复制。
  • 通过持久化模型版本和滚动时间窗预测,确保完整的模型血缘关系和可追溯性。
  • 在智能电网预测应用的真实工作负载下,评估系统的可扩展性。

提出的方法

  • 系统采用微服务架构,时间序列管理和服务与模型管理服务分别部署在无服务器云平台上。
  • 时间序列数据存储在基于知识库的数据存储中,支持语义推理,用于特征工程和模型配置。
  • 模型实现使用Python或R编写,打包为PyPI仓库,并针对特定语义实例(如变电所、建筑)进行程序化部署。
  • 模型调度采用事件驱动机制,基于用户定义的计划定期检查,以触发训练或推理。
  • 模型执行利用无服务器函数,配备2个CPU和2GB内存,支持自动并行化和水平扩展。
  • 通过将所有训练过的模型版本和滚动时间窗预测持久化存储于集中式数据库,完整保留模型血缘关系。

实验结果

研究问题

  • RQ1如何在生产环境中自动部署和扩展数千个物联网实体的AI时间序列模型?
  • RQ2语义知识图谱在多大程度上能够支持物联网应用中可重用和可组合的模型实现?
  • RQ3在无服务器、云原生架构中执行数万个AI模型推理任务的性能和可扩展性如何?
  • RQ4该系统如何在多个模型版本和预测之间保持模型血缘关系和可追溯性?
  • RQ5在扩展模型执行时,实际的性能瓶颈是什么,以及如何缓解?

主要发现

  • 在塞浦路斯智能电网部署中,174个模型的平均模型评分时长为15.9秒,所有站点的延迟均低于20秒。
  • 在175个并行模型执行下,系统每小时持续处理27,600个评分任务,表现出高吞吐量和可扩展性。
  • 并行任务超过175个后性能增益减弱,200个任务仅实现26,700个任务/小时,表明受数据库后端限制,性能达到平台期。
  • 系统实现了174个模型的半自动部署,仅基于6个模型实现,证明了高度的模型重用和可配置性。
  • 完整保留了模型血缘关系,支持使用持久化的滚动窗口预测,对多个预测时间范围进行模型性能验证。
  • 系统在智能电网应用中展示了实时大规模预测的可行性,支持对数百个局部能源需求和发电预测进行实时更新。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。