Skip to main content
QUICK REVIEW

[论文解读] XCloud: Design and Implementation of AI Cloud Platform with RESTful API Service

Lu Xu, Yating Wang|arXiv (Cornell University)|Dec 14, 2019
IoT and Edge/Fog Computing参考文献 19被引用 5
一句话总结

XCloud 是一个开源的 AI 云平台,通过 RESTful API 暴露常见的计算机视觉和数据挖掘服务,使研究人员和开发者能够轻松将预训练模型集成到应用程序中。基于 PyTorch 和 Django 构建,它实现了低延迟推理(例如,皮肤疾病识别的平均延迟为 16ms),并通过模块化设计和 TensorRT 优化支持可扩展性,实现高性能部署。

ABSTRACT

In recent years, artificial intelligence (AI) has aroused much attention among both industrial and academic areas. However, building and maintaining efficient AI systems are quite difficult for many small business companies and researchers if they are not familiar with machine learning and AI. In this paper, we first evaluate the difficulties and challenges in building AI systems. Then an cloud platform termed XCloud, which provides several common AI services in form of RESTful APIs, is constructed. Technical details are discussed in Section 2. This project is released as open-source software and can be easily accessed for late research. Code is available at https://github.com/lucasxlu/XCloud.git.

研究动机与目标

  • 解决研究人员和不熟悉机器学习流程的小型企业难以构建和部署 AI 系统的问题。
  • 通过提供可访问的开源云服务,弥合学术 AI 研究模型与生产就绪应用程序之间的差距。
  • 通过标准化、高性能的 RESTful API,实现 AI 能力在各类应用中的快速集成。
  • 通过模块化控制器架构,允许开发者插入自定义模型,实现可扩展性。
  • 通过负载均衡、压力测试以及基于 TensorRT 的推理优化,确保高性能和稳定性。

提出的方法

  • XCloud 使用 Django 作为后端框架,使用 PyTorch 进行模型训练和推理。
  • 通过 HTTP POST 和 GET 方法的 RESTful API 暴露 AI 服务,输入通过图像 URL 或原始图像数据提供。
  • 平台采用模块化 MVC 架构,将视图、控制器和模型分离,以提高可维护性和可扩展性。
  • 预训练模型包括 ResNet18、ResNet50、DenseNet121 和 HMTNet,已在特定数据集上微调,用于植物和疾病识别等任务。
  • 通过 TensorRT 加速模型推理,在两块 2080TI GPU 上实现 97.63 FPS 的性能——显著快于原生 PyTorch 推理(29.45 FPS)。
  • 用户和 API 使用数据记录在 MySQL 关系型表中,用于监控和分析。

实验结果

研究问题

  • RQ1如何设计一个云平台,以简化非专业用户在科研和小企业中部署 AI 模型的流程?
  • RQ2哪些架构模式能够实现通过 RESTful API 高效、可扩展且可扩展地暴露 AI 服务?
  • RQ3在类似生产环境的条件下,使用 TensorRT 进行模型优化如何影响推理延迟和吞吐量?
  • RQ4统一平台在多大程度上能够支持多样化的 AI 任务,如图像分类、面部属性预测和内容过滤?
  • RQ5在标准硬件条件下,使用真实负载条件下的性能和稳定性指标能达到何种水平?

主要发现

  • XCloud 在皮肤疾病识别任务中实现平均 16ms 的延迟,在面部美貌预测任务中实现 25ms 的延迟,压力测试的成功率为 100%。
  • 平台表现出高稳定性,在 JMeter 压力测试中所有测试 API 均未出现错误,验证了其可靠性。
  • 在两块 2080TI GPU 上,基于 TensorRT 的推理实现 97.63 FPS 的性能,相比原生 PyTorch 推理(29.45 FPS)提升 3.3 倍。
  • 在标准硬件(2080TI GPU 和 Intel Xeon CPU)上,系统支持每秒 20 个查询(QPS),表明其具备强大的可扩展潜力。
  • 通过插件式控制器架构,平台可实现新 AI 模型的无缝集成,显著降低自定义模型的部署复杂度。
  • 在 GitHub 上的开源发布使研究人员能够访问、扩展和复现该系统,促进了可复现性和协作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。