Skip to main content
QUICK REVIEW

[논문 리뷰] SMLT: A Serverless Framework for Scalable and Adaptive Machine Learning Design and Training

Ahsan Ali, Syed Zawad|arXiv (Cornell University)|2022. 05. 04.
Cloud Computing and Resource Management인용 수 4
한 줄 요약

SMLT는 서버리스 플랫폼의 고유한 제약 조건—무상태성, 짧은 함수 실행 시간, 통신 오버헤드—를 극복하고 동적으로 자원을 스케줄링하여 확장성 있고 적응형이며 사용자 중심의 머신러닝 모델 훈련을 가능하게 하는 서버리스 프레임워크입니다. 기존 최신 기술 기반의 VM 기반 및 서버리스 ML 시스템과 비교해 훈련 속도가 최대 8배 빠르고 비용이 최대 3배 낮아릅니다.

ABSTRACT

In today's production machine learning (ML) systems, models are continuously trained, improved, and deployed. ML design and training are becoming a continuous workflow of various tasks that have dynamic resource demands. Serverless computing is an emerging cloud paradigm that provides transparent resource management and scaling for users and has the potential to revolutionize the routine of ML design and training. However, hosting modern ML workflows on existing serverless platforms has non-trivial challenges due to their intrinsic design limitations such as stateless nature, limited communication support across function instances, and limited function execution duration. These limitations result in a lack of an overarching view and adaptation mechanism for training dynamics and an amplification of existing problems in ML workflows. To address the above challenges, we propose SMLT, an automated, scalable, and adaptive serverless framework to enable efficient and user-centric ML design and training. SMLT employs an automated and adaptive scheduling mechanism to dynamically optimize the deployment and resource scaling for ML tasks during training. SMLT further enables user-centric ML workflow execution by supporting user-specified training deadlines and budget limits. In addition, by providing an end-to-end design, SMLT solves the intrinsic problems in serverless platforms such as the communication overhead, limited function execution duration, need for repeated initialization, and also provides explicit fault tolerance for ML training. SMLT is open-sourced and compatible with all major ML frameworks. Our experimental evaluation with large, sophisticated modern ML models demonstrate that SMLT outperforms the state-of-the-art VM based systems and existing serverless ML training frameworks in both training speed (up to 8X) and monetary cost (up to 3X)

연구 동기 및 목표

  • 기존 서버리스 플랫폼이 동적이고 장시간 실행되는 ML 훈련 워크플로우를 지원하는 데에 한계를 보이는 문제를 해결하기 위해.
  • 사용자가 설정한 마감일 및 예산 제약 조건 하에 자동화되고 적응형 자원 스케줄링을 가능하게 하기 위해.
  • 서버리스 ML 실행에서 통신 오버헤드, 함수 타임아웃 제한 및 반복적인 초기화를 제거하기 위해.
  • 서버리스 환경에서의 ML 훈련을 위한 명시적 장애 내성 및 종단 간 워크플로우 관리를 제공하기 위해.
  • 모든 주요 ML 프레임워크를 지원하는 완전히 호환 가능한 오픈소스 프레임워크를 제공하기 위해.

제안 방법

  • SMLT는 실시간 훈련 동적 특성과 워크로드 수요에 기반해 동적으로 자원을 할당하고 스케일링하는 자동화되고 적응형 스케줄링 메커니즘을 사용합니다.
  • 기본 함수 실행 시간 제한을 초월하는 장시간 훈련 프로세스를 관리하기 위해 ML 훈련을 세밀한 상태 기반 서버리스 함수로 분해합니다.
  • 상호 함수 간 통신과 상태 지속성을 가능하게 하기 위해 경량의 조율 레이어를 구현하여 통신 오버헤드를 감소시킵니다.
  • 모델 상태를 체크포인팅하고 전체 훈련 작업을 다시 처리하지 않고도 장애 복구를 가능하게 함으로써 장애 내성을 통합합니다.
  • 훈련 마감일 및 예산 제약 조건과 같은 사용자 정의 제약 조건을 지원하며, 이를 바탕으로 자원 할당을 조정합니다.
  • 서버리스 복잡성을 추상화하면서도 PyTorch 및 Tensorflow와 같은 인기 있는 ML 프레임워크와의 호환성을 유지하는 종단 간 파이프라인으로 설계되어 있습니다.

실험 결과

연구 질문

  • RQ1서버리스 컴퓨팅은 고유한 플랫폼 제약 조건에도 불구하고 장시간 실행되며 동적인 머신러닝 훈련 워크플로우를 효과적으로 지원하기 위해 어떻게 적응시킬 수 있는가?
  • RQ2서버리스 ML 훈련에서 통신 오버헤드와 함수 초기화를 최소화하기 위해 필요한 스케줄링 및 조율 메커니즘은 무엇인가?
  • RQ3서버리스 프레임워크는 기존의 VM 기반 및 기존 서버리스 ML 시스템과 비교해 뛰어난 훈련 성능과 비용 효율성을 달성할 수 있는가?
  • RQ4사용자가 설정한 마감일 및 예산 제약 조건을 완전히 자동화되고 적응형 훈련 시스템에 어떻게 통합할 수 있는가?
  • RQ5무상태 서버리스 환경에서 ML 훈련을 위한 장애 내성 및 상태 관리를 가능하게 하는 아키텍처 패턴은 무엇인가?

주요 결과

  • SMLT는 최신 기술 기반의 VM 기반 시스템과 비교해 최대 8배 빠른 훈련 속도를 달성하여 대규모 모델의 훈련 시간을 크게 단축시킵니다.
  • 기존 서버리스 ML 훈련 솔루션과 VM 기반 기준선과 비교해 비용을 최대 3배 낮춥니다.
  • 함수 타임아웃과 무상태성의 영향을 줄이기 위해 체크포인팅과 조율된 함수 체인을 통해 상태 기반 실행을 가능하게 하여 성공적으로 완화했습니다.
  • PyTorch 및 Tensorflow를 포함한 주요 ML 프레임워크와 높은 호환성을 유지하며, 모델이나 프레임워크 수정 없이도 작동합니다.
  • 사용자가 설정한 훈련 마감일 및 예산 제약 조건은 동적 자원 할당과 적응형 스케줄링을 통해 효과적으로 이행되었습니다.
  • 종단 간 평가를 통해 SMLT가 다양한 대규모 현대 ML 모델에서 뛰어난 강건성과 효율성을 입증했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.