Skip to main content
QUICK REVIEW

[논문 리뷰] HOLMES: Health OnLine Model Ensemble Serving for Deep Learning Models in Intensive Care Units

Shenda Hong, Yanbo Xu|arXiv (Cornell University)|2020. 08. 10.
Machine Learning in Healthcare참고 문헌 37인용 수 4
한 줄 요약

HOLMES는 심폐집중치료실(ICU)에서 딥러닝을 위한 지연 시간을 고려한 온라인 모델 앙상블 서비스 시스템으로, 밀리초 이내의 지연 시간과 높은 정확도를 동시에 확보하기 위해 동적으로 최적의 모델 앙상블을 구성한다. 배치 처리 방식에 비해 지연 시간을 한 단계 낮추며, 100명의 환자, 250 Hz의 웨이브폼 스트리밍 환경에서 소아 심장집중치료실 데이터에서 95% 이상의 예측 정확도를 달성한다.

ABSTRACT

Deep learning models have achieved expert-level performance in healthcare with an exclusive focus on training accurate models. However, in many clinical environments such as intensive care unit (ICU), real-time model serving is equally if not more important than accuracy, because in ICU patient care is simultaneously more urgent and more expensive. Clinical decisions and their timeliness, therefore, directly affect both the patient outcome and the cost of care. To make timely decisions, we argue the underlying serving system must be latency-aware. To compound the challenge, health analytic applications often require a combination of models instead of a single model, to better specialize individual models for different targets, multi-modal data, different prediction windows, and potentially personalized predictions. To address these challenges, we propose HOLMES-an online model ensemble serving framework for healthcare applications. HOLMES dynamically identifies the best performing set of models to ensemble for highest accuracy, while also satisfying sub-second latency constraints on end-to-end prediction. We demonstrate that HOLMES is able to navigate the accuracy/latency tradeoff efficiently, compose the ensemble, and serve the model ensemble pipeline, scaling to simultaneously streaming data from 100 patients, each producing waveform data at 250~Hz. HOLMES outperforms the conventional offline batch-processed inference for the same clinical task in terms of accuracy and latency (by order of magnitude). HOLMES is tested on risk prediction task on pediatric cardio ICU data with above 95% prediction accuracy and sub-second latency on 64-bed simulation.

연구 동기 및 목표

  • 심폐집중치료실(ICU)에서 실시간성과 정밀도가 환자 결과와 치료 비용에 직접적인 영향을 미치는 바람직한 저지연, 고정확도 모델 서비스의 필수적 필요성을 해결하기 위해.
  • 기존의 배치 처리 추론 방식이 데이터 노후화와 높은 지연 시간을 유발하는 한계를 극복하기 위해, 지속적인 스트리밍 다중 모odal ICU 데이터를 대상으로 온라인 추론을 가능하게 하기 위해.
  • 다양한 데이터 모달리티, 예측 윈도우 또는 환자 집단에서 훈련된 여러 전문화된 모델들로부터, 엄격한 밀리초 이내 지연 시간 서비스 수준 목표(SLO)를 충족시키면서 최적의 모델 앙상블을 동적으로 조합하기 위해.
  • 고정된 현장 내 병원 컴퓨팅 제약 조건 내에서 작동하는 확장성 있고 자원 효율적인 서비스 플랫폼을 제공하여 정확도-지연 시간 트레이드오프를 효과적으로 관리하기 위해.
  • 실제 ICU 환경에서 온라인 모델 앙상블 서비스가 기존의 오프라인 배치 처리 방식에 비해 예측 정확도와 추론 속도 양면에서 뚜렷한 향상을 이끌어내는지 입증하기 위해.

제안 방법

  • HOLMES는 후보 모델 앙상블의 성능을 완전한 프로파일링 없이도 예측할 수 있도록 보조 모델 기반 최적화 프레임워크를 사용하여, 비용이 많이 들고 시간이 오래 소요되는 평가의 필요성을 줄인다.
  • 실시간 처리를 위해 상태 기반 컴포넌트(예: 데이터 집계, 버퍼링)와 상태 비기반 컴포넌트(예: 모델 추론)의 하이브리드 파이프라인을 조율하기 위해 오픈소스 Ray 프레임워크를 활용한다.
  • 지연 시간을 고려한 앙상블 컴poser를 도입하여 예측된 정확도와 측정된 지연 시간을 기반으로 최고 성능을 보이는 모델 조합을 선택함으로써, 밀리초 이내 SLO를 준수한다.
  • HOLMES는 다중 속도, 다중 모달 데이터 수신(예: 250 Hz에서의 ECG)을 지원하며, 동시에 최대 100명의 환자 데이터를 스트리밍 방식으로 처리한다.
  • 상태 기반 데이터 집계와 모델 추론을 통합하여 가장 최신의 환자 데이터를 사용해 즉각적인 예측을 가능하게 하여 데이터의 노후화를 줄인다.
  • 자원 제약 조건이 변화하는 상황에서도 확장 가능하도록 설계되었으며, 다양한 GPU 수와 환자 부하 수준에서 성능이 평가되었다.

실험 결과

연구 질문

  • RQ1온라인 모델 앙상블 서비스 시스템은 실시간 심폐집중치료실 모니터링 환경에서 높은 예측 정확도를 유지하면서도 밀리초 이내의 종단 간 지연 시간을 달성할 수 있는가?
  • RQ2비정상적인 모델 또는 배치 처리 추론 방식에 비해, 동적 모델 앙상블 조합은 임상적 위험 예측 환경에서 정확도를 얼마나 향상시키는가?
  • RQ3보조 모델링을 통해 정확도-지연 시간 트레이드오프 탐색의 비용을 얼마나 줄일 수 있는가?
  • RQ4다양한 데이터 모달리티와 주파수를 가진 고처리량, 다중 환자 스트리밍 워크로드 환경에서 HOLMES는 어떻게 확장되는가?
  • RQ5심폐집중치료실 위험 예측 작업에서 온라인 추론과 기존의 오프라인 배치 처리 방식 간의 지연 시간과 예측 정확도 격차는 어느 정도인가?

주요 결과

  • HOLMES는 기존의 오프라인 배치 처리 방식에 비해 종단 간 추론 지연 시간을 한 단계 낮추며, 고부하 상황에서도 밀리초 이내의 지연 시간을 달성한다.
  • 소아 심장집중치료실 위험 예측 작업에서 95% 이상의 예측 정확도를 유지하며, 10개 모델로 구성된 앙상블의 95번째 백분위수 지연 시간은 1.15초 이하였다.
  • 64병상 시뮬레이션 환경에서 HOLMES는 2개 GPU로 16,000건의 쿼리/초(16명의 환자 × 250 qps)를 처리할 수 있었으며, 고처리량 입력 환경에서도 뛰어난 성능을 보였다.
  • 보조 모델을 활용해 HOLMES는 정확도-지연 시간 트레이드오프 공간을 효율적으로 탐색하며, 전체 프로파일링 평가 수를 줄여가며 고성능 앙상블를 식별했다.
  • GPU 수가 많아질수록 지연 시간이 감소하여, 자원 확장이 성능 향상에 기여하고, 대기 시간 지연이 줄어들며 경쟁이 감소함을 보였다.
  • 온라인 서비스 방식은 데이터의 노후화를 줄여 정확도를 높이는 데 기여했으며, 이는 예측 지연 시간과 성능 간의 역관계로 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.