Skip to main content
QUICK REVIEW

[논문 리뷰] A Data as a Service (DaaS) Model for GPU-based Data Analytics

John Olorunfemi Abe, Burak Berk Ustundaug|arXiv (Cornell University)|2018. 02. 05.
Cloud Computing and Resource Management참고 문헌 14인용 수 4
한 줄 요약

이 논문은 실시간 빅데이터 분석을 위한 GPU 가속 기반의 데이터로서의 서비스(DaaS) 모델을 제안한다. 이 모델은 GPU 기반 병렬 처리와 자기조직화 맵(SOM)을 활용하여 효율적인 클러스터링을 실현한다. NVIDIA GPU를 활용한 실험을 통해 사전 처리 및 클러스터링 작업에서 뚜렷한 성능 향상을 입증하였으며, 클라우드 및 데이터센터 워크로드 환경에서 더 빠르고 확장 가능한 분석과 함께 서비스 수준 합의(SLA)/서비스 품질(QoS) 준수도 향상시켰다.

ABSTRACT

Cloud-based services with resources to be provisioned for consumers are increasingly the norm, especially with respect to Big data, spatiotemporal data mining and application services that impose a user's agreed Quality of Service (QoS) rules or Service Level Agreement (SLA). Considering the pervasive nature of data centers and cloud system, there is a need for a real-time analytics of the systems considering cost, utility and energy. This work presents an overlay model of GPU system for Data As A Service (DaaS) to give a real-time data analysis of network data, customers, investors and users' data from the datacenters or cloud system. Using a modeled layer to define a learning protocol and system, we give a custom, profitable system for DaaS on GPU. The GPU-enabled pre-processing and initial operations of the clustering model analysis is promising as shown in the results. We examine the model on real-world data sets to model a big data set or spatiotemporal data mining services. We also produce results of our model with clustering, neural networks' Self-organizing feature maps (SOFM or SOM) to produce a distribution of the clustering for DaaS model. The experimental results thus far show a promising model that could enhance SLA and or QoS based DaaS.

연구 동기 및 목표

  • 클라우드 및 데이터센터 환경에서 실시간, 비용 효율적이고 에너지 효율적인 빅데이터 분석의 증가하는 수요를 해결하기 위해.
  • 데이터 집약적인 클라우드 서비스에서 서비스 품질(QoS) 및 서비스 수준 합의(SLA) 준수를 향상시키기 위해.
  • 기계학습 워크로드를 위한 GPU 병렬 처리를 활용한 확장 가능하고 미들웨어 최적화된 DaaS 아키텍처를 설계하기 위해.
  • 실세계 시공간 및 농업 데이터에 대해 GPU 가속 클러스터링을 사용한 자기조직화 맵(SOM)의 효과성을 평가하기 위해.
  • 의료 정보 기술(e-health), 사이버보안 및 스마트 시티 분야에서 저지연, 고처리량 데이터 분석을 위한 GPU 기반 시스템의 실현 가능성을 입증하기 위해.

제안 방법

  • DaaS에 통합된 GPU 가속 기반의 머신러닝 파이프라인을 위한 오버레이 GPU 시스템 모델을 설계한다.
  • CUDA를 지원하는 GPU 아키텍처(NVIDIA GF108GL 및 GF114)를 활용해 병렬 데이터 사전 처리 및 클러스터링을 수행한다.
  • 데이터 분포 모델링 및 패턴 식별을 위해 핵심 클러스터링 알고리즘으로 자기조직화 맵(SOM)을 사용한다.
  • 가상 클러스터 간 GPU 작업 스케줄링, 로드 밸런싱 및 동기화를 관리하기 위해 미들웨어 레이어를 구현한다.
  • 시스템 유틸리티를 최대화하기 위해 자원 할당 제약 조건(N개의 총 노드, μ_i 서비스 속도, λ_i 도착 속도)을 포함한 최적화 모델을 적용한다.
  • 클러스터 수준에 따라 클러스터 계수 대 클러스터 ID의 로그-로그 스케일 시각화를 사용해 클러스터링 성능을 분석한다.

실험 결과

연구 질문

  • RQ1DaaS 모델에서 실시간 데이터 분석을 가속화하기 위해 GPU 기반 병렬 처리를 어떻게 효과적으로 활용할 수 있는가?
  • RQ2자기조직화 맵(SOM)의 사용이 GPU 가속 DaaS 시스템에서 클러스터링 정확도 및 효율성에 어느 정도 기여하는가?
  • RQ3최적화된 자원 할당 및 로드 밸런싱을 통해 미들웨어 레이어가 GPU 기반 클라우드 분석 환경에서 SLA 및 QoS 준수를 향상시킬 수 있는가?
  • RQ4제안된 모델은 실세계 시공간 및 농업 데이터 세트에서 처리 속도 및 클러스터링 품질 측면에서 어떻게 성능을 발휘하는가?
  • RQ5GPU 하드웨어(CUDA 코어, 메모리 등)가 DaaS 모델의 확장성 및 성능에 미치는 영향은 무엇인가?

주요 결과

  • GPU 가속 DaaS 모델은 전통적인 CPU 기반 접근 방식에 비해 데이터 사전 처리 및 클러스터링에서 뚜렷한 빠름을 보였다.
  • 자기조직화 맵(SOM)은 데이터 분포를 효과적으로 시각화하고 클러스터링하여 GPU 환경에서 강력한 패턴 탐지 능력을 입증하였다.
  • NVIDIA GF108GL(96개 CUDA 코어) 및 GF114(384개 CUDA 코어) GPU에서 모델은 성능 향상과 확장성을 보였으며 처리 속도 향상이 명확하게 측정되었다.
  • 루트 평균 제곱 오차(RMSE) 값은 클러스터 수준이 증가함에 따라 감소하여 모델 정확도 향상 및 수렴성 향상을 시사하였다.
  • 클러스터 계수 대 클러스터 ID의 로그-로그 플롯은 다양한 데이터 수준에서 일관되고 뚜렷한 클러스터링 행동을 보였다.
  • 의료 정보 기술(e-health), 사이버보안, 재난 관리 및 스마트 시티 응용 분야에서 실시간 분석 잠재력을 높게 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.