Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Deployment of AI Time-series Models for IoT

Bradley Eck, Francesco Fusco|arXiv (Cornell University)|2020. 03. 24.
Time Series Analysis and Forecasting참고 문헌 8인용 수 5
한 줄 요약

이 논문은 IoT 애플리케이션에서 AI 시계열 모델을 확장 가능하게 배포하기 위한 클라우드 네이티브 시스템인 IBM Research Castor을 제시한다. 서버리스 컴퓨팅과 의미적 지식 그래프를 활용하여 수천 개의 모델을 자동으로 병렬 실행할 수 있으며, 평균 추론 지연 시간이 20초 이하이며 시간당 최대 27,600개의 모델 스코링 작업을 지원한다. 동시에 175개의 병행 실행을 지원한다.

ABSTRACT

IBM Research Castor, a cloud-native system for managing and deploying large numbers of AI time-series models in IoT applications, is described. Modelling code templates, in Python and R, following a typical machine-learning workflow are supported. A knowledge-based approach to managing model and time-series data allows the use of general semantic concepts for expressing feature engineering tasks. Model templates can be programmatically deployed against specific instances of semantic concepts, thus supporting model reuse and automated replication as the IoT application grows. Deployed models are automatically executed in parallel leveraging a serverless cloud computing framework. The complete history of trained model versions and rolling-horizon predictions is persisted, thus enabling full model lineage and traceability. Results from deployments in real-world smart-grid live forecasting applications are reported. Scalability of executing up to tens of thousands of AI modelling tasks is also evaluated.

연구 동기 및 목표

  • 대규모 IoT 시스템에서 수천 개의 AI 시계열 모델을 수동으로 배포하고 관리하는 데 도전하는 문제를 해결하기 위해.
  • 서버리스 클라우드 컴퓨팅을 활용하여 AI 모델의 자동화되고 확장 가능한 실행을 가능하게 하기 위해.
  • 시계열 데이터와 모델 템플릿의 의미적 모델링을 통해 모델 재사용과 자동 복제를 지원하기 위해.
  • 모델 버전과 롤링-호라이즌 예측을 영구 저장하여 전체 모델 라인리지와 추적 가능성을 보장하기 위해.
  • 스마트그리드 예측 응용 분야에서 실제 워크로드를 기반으로 한 시스템 확장성 평가를 위해.

제안 방법

  • 시스템은 서버리스 클라우드 플랫폼에 배포된 별도의 시계열 데이터 관리 및 모델 관리 서비스를 포함하는 마이크로서비스 아키텍처를 사용한다.
  • 시계열 데이터는 의미적 추론을 통해 기능 엔지니어링과 모델 구성에 활용할 수 있는 지식 기반 데이터 스토어에 저장된다.
  • 모델 구현은 Python 또는 R로 작성되며, PyPI 레지지터리에 패키징되어 특정 의미적 인스턴스(예: 변전소, 건물)에 대해 프로그래밍 방식으로 배포된다.
  • 모델 스케줄링은 이벤트 기반으로 작동하며, 사용자가 정의한 스케줄에 따라 주기적으로 점검하여 학습 또는 추론을 트리거한다.
  • 모델 실행은 서버리스 함수를 활용하며, 2개의 CPU와 2GB RAM을 사용하여 자동 병렬 처리 및 수평적 확장이 가능하다.
  • 모든 훈련된 모델 버전과 롤링-호라이즌 예측을 중앙 집중식 데이터베이스에 영구 저장함으로써 전체 모델 라인리지를 유지한다.

실험 결과

연구 질문

  • RQ1생산 환경에서 수천 개의 IoT 엔티티에 걸쳐 AI 시계열 모델을 자동으로 배포하고 확장할 수 있는 방법은 무엇인가?
  • RQ2의미적 지식 그래프는 IoT 응용 분야에서 재사용 가능하고 조합 가능한 모델 구현을 얼마나 잘 지원할 수 있는가?
  • RQ3서버리스이고 클라우드 네이티브 아키텍처에서 수만 개의 AI 모델 추론 작업을 실행할 경우 성능과 확장성은 어떻게 되는가?
  • RQ4시스템은 여러 모델 버전과 예측 간의 모델 라인리지와 추적 가능성을 어떻게 유지하는가?
  • RQ5모델 실행을 확장할 때 발생하는 실질적인 성능 저하 요인은 무엇이며, 이를 어떻게 완화할 수 있는가?

주요 결과

  • 키프로스 스마트그리드 배포에서 174개의 모델에 대해 평균 모델 스코링 시간이 15.9초였으며, 모든 사이트에서 20초 이하의 지연 시간을 기록했다.
  • 175개의 병행 모델 실행을 통해 시간당 27,600개의 스코링 작업을 지속적으로 처리하여 높은 처리량과 확장성을 입증했다.
  • 175개의 병행 작업을 초과하면 성능 향상 폭이 감소했으며, 200개의 작업에서는 단지 시간당 26,700개의 작업을 처리하여 데이터베이스 백엔드 제약으로 인한 성능 정체를 보였다.
  • 사이트 3에서 단지 6개의 모델 구현으로 174개의 모델을 준자동으로 배포할 수 있었으며, 이는 높은 모델 재사용성과 구성 가능성의 증거였다.
  • 모든 모델 라인리지를 유지하여 영구 저장된 롤링 윈도우 예측를 활용해 다양한 예측 환경에서 모델 성능을 검증할 수 있었다.
  • 실시간으로 수백 개의 국지적 에너지 수요 및 생산 예측를 업데이트할 수 있어 스마트그리드 응용 분야에서 실시간 대규모 예측의 실현 가능성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.