[论文解读] AI-oriented Medical Workload Allocation for Hierarchical Cloud/Edge/Device Computing
本文提出了一种面向紧急医疗场景下分层云/边缘/终端系统的AI导向工作负载分配策略,通过根据处理和传输延迟动态地将医疗AI工作负载(例如生死预测、呼吸困难警报)分配至最合适的层级(云、边缘或终端),以优化响应时间。与固定层级部署策略相比,该方法可将总响应时间减少高达63%。
In a hierarchically-structured cloud/edge/device computing environment, workload allocation can greatly affect the overall system performance. This paper deals with AI-oriented medical workload generated in emergency rooms (ER) or intensive care units (ICU) in metropolitan areas. The goal is to optimize AI-workload allocation to cloud clusters, edge servers, and end devices so that minimum response time can be achieved in life-saving emergency applications. In particular, we developed a new workload allocation method for the AI workload in distributed cloud/edge/device computing systems. An efficient scheduling and allocation strategy is developed in order to reduce the overall response time to satisfy multi-patient demands. We apply several ICU AI workloads from a comprehensive edge computing benchmark Edge AIBench. The healthcare AI applications involved are short-of-breath alerts, patient phenotype classification, and life-death threats. Our experimental results demonstrate the high efficiency and effectiveness in real-life health-care and emergency applications.
研究动机与目标
- 解决在三层云/边缘/终端架构中,降低延迟敏感型医疗AI应用响应时间的挑战。
- 根据计算能力和网络状况,识别单个AI工作负载在云、边缘或终端设备中的最优部署层级。
- 为多个并发医疗AI任务设计调度策略,以最小化总响应时间和最后完成响应时间。
- 使用真实ICU数据集和边缘AI基准对所提策略进行评估,以确保其临床相关性与实际有效性。
提出的方法
- 将响应时间形式化为处理时间(依赖于设备计算能力)与传输时间(依赖于网络带宽)之和。
- 将工作负载分配建模为在三个层级间计算负载与通信开销之间的权衡。
- 提出一种单任务优化算法,通过解析延迟估计选择端到端响应时间最小的部署层级。
- 设计一种基于启发式的调度算法,用于多任务场景,通过优先排序工作负载序列以最小化累积响应时间。
- 整合Edge AIBench中的工作负载表征,包括患者表型分类和生死威胁检测等真实医疗AI工作负载。
- 使用数值分析与仿真,将所提策略与固定部署策略(如全部部署在云、边缘或终端)进行对比。
实验结果
研究问题
- RQ1在分层云/边缘/终端系统中,单个AI工作负载的最优部署层级(云、边缘或终端)是什么,以最小化响应时间?
- RQ2在多任务医疗AI场景中,跨层级的动态工作负载分配如何影响总响应时间?
- RQ3当多个延迟敏感型医疗AI任务按顺序处理时,何种调度策略可最小化整体响应时间?
- RQ4与固定层级部署策略相比,所提分配策略在ICU应用中响应时间减少的性能如何?
主要发现
- 所提工作负载分配策略实现了150个单位的总响应时间,比按每项任务最优层级部署(227个单位)降低了33%。
- 该策略将最后完成时间减少至43个单位,相比部署在云服务器(74个单位)实现了63%的改进。
- 与全部部署在边缘服务器相比,所提方法将响应时间降低了63%(416 vs. 150个单位)。
- 在总响应时间和最后响应时间方面,该策略均优于所有基线方法,包括部署在终端设备(366个单位)和边缘服务器(416个单位)。
- 结果表明,基于工作负载特性与系统约束的动态层级选择,显著优于静态部署方式。
- 启发式调度算法能有效减少任务排队延迟,尤其在高并发场景下对优先级医疗工作负载具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。