Skip to main content
QUICK REVIEW

[논문 리뷰] Rafiki: Machine Learning as an Analytics Service System

Wei Wang, Sheng Wang|arXiv (Cornell University)|2018. 04. 17.
Data Stream Mining Techniques참고 문헌 30인용 수 15
한 줄 요약

Rafiki는 데이터베이스 사용자가 SQL 호환 인터페이스를 통해 쉽게 머신러닝 모델—특히 딥러닝 모델—을 훈련하고 배포할 수 있도록 해주는 클라우드 기반 머신러닝 서비스 시스템이다. 분산 하이퍼파라미터 튜닝을 지원해 효율적인 훈련을 가능하게 하고, 추론 지연 시간과 정확도를 균형 잡는 온라인 앙상블 모델링을 통해 비전문가 사용자에게 대용량 데이터 분석 워크로드에서의 사용성과 성능을 크게 향상시킨다.

ABSTRACT

Big data analytics is gaining massive momentum in the last few years. Applying machine learning models to big data has become an implicit requirement or an expectation for most analysis tasks, especially on high-stakes applications.Typical applications include sentiment analysis against reviews for analyzing on-line products, image classification in food logging applications for monitoring user's daily intake and stock movement prediction. Extending traditional database systems to support the above analysis is intriguing but challenging. First, it is almost impossible to implement all machine learning models in the database engines. Second, expertise knowledge is required to optimize the training and inference procedures in terms of efficiency and effectiveness, which imposes heavy burden on the system users. In this paper, we develop and present a system, called Rafiki, to provide the training and inference service of machine learning models, and facilitate complex analytics on top of cloud platforms. Rafiki provides distributed hyper-parameter tuning for the training service, and online ensemble modeling for the inference service which trades off between latency and accuracy. Experimental results confirm the efficiency, effectiveness, scalability and usability of Rafiki.

연구 동기 및 목표

  • 딥러닝 전문 지식 없이도 복잡한 분석 워크로드에서 데이터베이스 시스템에 머신러닝을 통합하는 데 도전 과제를 해결하기 위해.
  • 확장 가능한 분산 하이퍼파라미터 튜닝 서비스를 제공해 모델 훈련 및 튜닝의 부담을 줄이기 위해.
  • 정확도와 응답 시간을 균형 잡는 적응형 온라인 앙상블 모델링을 통해 효율적이고 저지연 추론을 가능하게 하기 위해.
  • 데이터 업로드, 모델 훈련, 배포, 질의에 이르는 엔드 투 엔드 머신러닝 워크플로우를 클라우드 기반 분석 플랫폼 내에서 지원하기 위해.
  • UDF와 웹 API를 통해 머신러닝 복잡성을 추상화해 데이터베이스 개발자의 사용성을 향상시키기 위해.

제안 방법

  • Rafiki는 머신러닝 모델을 웹 API로 노출하는 클라우드 네이티브 플랫폼을 제공하여 사용자 정의 함수(UDF)를 통한 SQL 쿼리와의 통합을 가능하게 한다.
  • 다양한 워커에서 병렬화된 훈련 작업을 사용해 분산 하이퍼파라미터 튜닝을 지원하여 모델 성능을 효율적으로 최적화한다.
  • 추론을 위해 Rafiki는 요청 부하와 성능 트레이드오프에 따라 앙상블에 포함된 모델 수를 동적으로 조정하는 온라인 앙상블 모델링을 적용한다.
  • 시스템은 강화학습 기반 컨트롤러를 사용해 실시간으로 앙상블 크기를 조정함으로써 정확도와 지연 시간을 균형 잡는다.
  • 강화학습 컨트롤러의 보상 함수는 정확도와 오버두된 요청에 대한 보상 항목을 포함하며, 조정 가능한 트레이드오프 파라미터 β를 포함한다.
  • 시스템은 모델 라이프사이클 관리(재훈련 및 재배포 포함)를 지원하며, 기존 SQL 쿼리와의 역호환성을 확보한다.

실험 결과

연구 질문

  • RQ1데이터베이스 분석 워크플로우 내에서 특정 데이터셋에 대해 머신러닝 모델을 효율적이고 자동으로 튜닝하는 방법은 무엇인가?
  • RQ2생산 환경의 머신러닝 서비스에서 추론 지연 시간과 예측 정확도 사이의 최적의 트레이드오프는 무엇인가?
  • RQ3저수준의 머신러닝 전문 지식 없이도 비전문가 데이터베이스 사용자가 복잡한 딥러닝 모델을 효과적으로 활용할 수 있는 방법은 무엇인가?
  • RQ4클라우드 기반 시스템이 하이퍼파라미터 튜닝과 추론을 확장하면서도 저지연과 높은 정확도를 유지할 수 있는가?
  • RQ5동적 앙상블 모델링은 다양한 요청 워크로드에 어떻게 적응하여 성능과 사용성을 유지하는가?

주요 결과

  • Rafiki는 분산 하이퍼파라미터 튜닝에서 높은 효율성과 확장성을 달성하여 복잡한 모델의 훈련 시간을 크게 단축시킨다.
  • 온라인 앙상블 모델링 접근법은 고부하 상황에서 고정 앙상블 기반 베이스라인 대비 오버두된 요청을 최대 60% 감소시키며 경쟁 수준의 정확도를 유지한다.
  • 강화학습 기반 컨트롤러는 요청 도착률에 적응하여 고부하 시 더 적은 수의 모델을 사용해 처리량을 향상시키고 오버두된 요청을 줄인다.
  • 보상 함수에서 β=1일 경우, β=0 대비 오버두된 요청을 45% 감소시키며 약간의 정확도 저하를 감수함으로써 효과적인 지연 제어를 입증한다.
  • 시스템은 딥러닝을 SQL 워크플로우에 원활하게 통합할 수 있도록 하며, Rafiki에서 모델을 재훈련하더라도 기존 SQL 쿼리에 대한 변경 사항이 필요 없어 역호환성을 보장한다.
  • 사례 연구에서는 Rafiki가 필터링된 행에 대해서만 온디맨드 추론을 가능하게 하여 개발 시간과 계산 자원 낭비를 줄임으로써 실세계 응용(예: 식품 로깅)에서 효율성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.