Skip to main content
QUICK REVIEW

[论文解读] HOLMES: Health OnLine Model Ensemble Serving for Deep Learning Models in Intensive Care Units

Shenda Hong, Yanbo Xu|arXiv (Cornell University)|Aug 10, 2020
Machine Learning in Healthcare参考文献 37被引用 4
一句话总结

HOLMES 是一种面向重症监护病房(ICUs)深度学习的延迟感知在线模型集成服务系统,通过动态组合最优模型集成,在亚秒级推理延迟与高精度之间实现平衡。相比批处理,其延迟降低了一个数量级,并在 100 名患者、250 Hz 心电图波形流数据上实现了 95% 以上的预测精度。

ABSTRACT

Deep learning models have achieved expert-level performance in healthcare with an exclusive focus on training accurate models. However, in many clinical environments such as intensive care unit (ICU), real-time model serving is equally if not more important than accuracy, because in ICU patient care is simultaneously more urgent and more expensive. Clinical decisions and their timeliness, therefore, directly affect both the patient outcome and the cost of care. To make timely decisions, we argue the underlying serving system must be latency-aware. To compound the challenge, health analytic applications often require a combination of models instead of a single model, to better specialize individual models for different targets, multi-modal data, different prediction windows, and potentially personalized predictions. To address these challenges, we propose HOLMES-an online model ensemble serving framework for healthcare applications. HOLMES dynamically identifies the best performing set of models to ensemble for highest accuracy, while also satisfying sub-second latency constraints on end-to-end prediction. We demonstrate that HOLMES is able to navigate the accuracy/latency tradeoff efficiently, compose the ensemble, and serve the model ensemble pipeline, scaling to simultaneously streaming data from 100 patients, each producing waveform data at 250~Hz. HOLMES outperforms the conventional offline batch-processed inference for the same clinical task in terms of accuracy and latency (by order of magnitude). HOLMES is tested on risk prediction task on pediatric cardio ICU data with above 95% prediction accuracy and sub-second latency on 64-bed simulation.

研究动机与目标

  • 为解决重症监护病房(ICUs)中对低延迟、高精度模型服务的迫切需求,其中及时性和精确性直接影响患者预后和医疗成本。
  • 通过在流式多模态 ICU 数据上实现持续的在线推理,克服传统批处理推理的局限性,避免数据陈旧性和高延迟问题。
  • 在满足严格亚秒级服务级别目标(SLOs)的前提下,从多个专用模型中动态组合最优模型集成——这些模型基于不同数据模态、预测时间窗口或患者队列进行训练。
  • 提供一种可扩展、资源高效的部署平台,运行于固定院内计算资源约束下,有效权衡精度与延迟。
  • 证明在线模型集成服务相比传统离线批处理,在真实 ICU 环境中显著提升了预测准确率和推理速度。

提出的方法

  • HOLMES 使用基于代理的优化框架,在完整性能评估前预测候选模型集成的性能,从而减少昂贵且耗时的全面评估需求。
  • 利用开源 Ray 框架编排混合流水线,包含有状态组件(如数据聚合、缓冲)和无状态组件(如模型推理),以实现实时处理。
  • 系统采用延迟感知的集成组合器,基于预测精度和实测延迟选择最佳性能模型组合,确保符合亚秒级 SLO 要求。
  • HOLMES 支持多速率、多模态数据摄入(如 250 Hz ECG),并以流式方式同时处理最多 100 名患者的多模态数据。
  • 通过将有状态数据聚合与模型推理集成,利用最新患者数据实现实时预测,从而减少数据陈旧性。
  • 系统设计具备在不同资源约束下的可扩展性,其性能在不同 GPU 数量和患者负载下进行了评估。

实验结果

研究问题

  • RQ1在线模型集成服务系统是否能在真实 ICU 监测中实现亚秒级端到端延迟,同时保持高预测精度?
  • RQ2与单模型或批处理推理方法相比,动态模型集成组合在重症监护环境中如何提升预测精度?
  • RQ3代理建模在多大程度上可降低探索模型集成选择中精度-延迟权衡的成本?
  • RQ4HOLMES 在高吞吐量、多患者流式工作负载下,面对多样化数据模态和频率时,其可扩展性如何?
  • RQ5在 ICU 风险预测任务中,与传统离线批处理相比,在延迟和预测精度方面,在线推理的性能差距有多大?

主要发现

  • 与传统离线批处理相比,HOLMES 将端到端推理延迟降低了一个数量级,在高负载下仍能实现亚秒级延迟。
  • 在儿科心脏重症监护病房风险预测任务中,系统保持超过 95% 的预测准确率,10 模型集成的第 95 百分位延迟低于 1.15 秒。
  • HOLMES 在 64 张床位的模拟场景中表现出色,使用 2 块 GPU 处理 16,000 次/秒查询(16 名患者 × 250 qps),在高数据摄入率下仍保持稳健性能。
  • 通过使用代理模型,HOLMES 高效探索了精度-延迟权衡空间,仅通过较少的完整性能评估即识别出高性能集成。
  • 随着 GPU 数量增加,延迟降低,表明资源扩展可提升性能,减少队列延迟和资源争用。
  • 在线服务方式通过减少数据陈旧性,显著提升了预测准确率,表现为预测延迟与性能之间的反比关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。