Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey of Big Data Machine Learning Applications Optimization in Cloud Data Centers and Networks

Sanaa Hamid Mohamed, Taisir E. H. El-Gorashi|arXiv (Cornell University)|2019. 01. 01.
Cloud Computing and Resource Management참고 문헌 600인용 수 6
한 줄 요약

이 종합 검토는 클라우드 데이터센터 및 네트워크에서 대용량 데이터 기반 머신러닝 워크로드를 위한 최적화 기법에 대한 포괄적인 분석을 제시하며, 응용 프로그램 수준, 네트워킹 수준, 데이터센터 수준의 최적화로 분류한다. 트래픽 혼잡, 에너지 소비, 다중 테넌시 비효율성 등의 주요 과제를 규명하고, 가상화, 소프트웨어 정의 네트워킹(SDN), 네트워크 기반 가상화(NFV), 컨테이너 기반 기술을 활용한 솔루션을 평가하여 분산 시스템 전반에서 성능, 공정성, 에너지 효율성을 향상시킨다.

ABSTRACT

This survey article reviews the challenges associated with deploying and optimizing big data applications and machine learning algorithms in cloud data centers and networks. The MapReduce programming model and its widely-used open-source platform; Hadoop, are enabling the development of a large number of cloud-based services and big data applications. MapReduce and Hadoop thus introduce innovative, efficient, and accelerated intensive computations and analytics. These services usually utilize commodity clusters within geographically-distributed data centers and provide cost-effective and elastic solutions. However, the increasing traffic between and within the data centers that migrate, store, and process big data, is becoming a bottleneck that calls for enhanced infrastructures capable of reducing the congestion and power consumption. Moreover, enterprises with multiple tenants requesting various big data services are challenged by the need to optimize leasing their resources at reduced running costs and power consumption while avoiding under or over utilization. In this survey, we present a summary of the characteristics of various big data programming models and applications and provide a review of cloud computing infrastructures, and related technologies such as virtualization, and software-defined networking that increasingly support big data systems. Moreover, we provide a brief review of data centers topologies, routing protocols, and traffic characteristics, and emphasize the implications of big data on such cloud data centers and their supporting networks. Wide ranging efforts were devoted to optimize systems that handle big data in terms of various applications performance metrics and/or infrastructure energy efficiency. Finally, some insights and future research directions are provided.

연구 동기 및 목표

  • 클라우드 환경에서 대용량 데이터 기반 머신러닝 응용 프로그램을 위한 최적화 전략을 식별하고 분류하는 것.
  • 트래픽 혼잡, 에너지 소비, 자원 과도/부족 활용 등 클라우드 데이터센터 및 네트워크의 과제를 분석하는 것.
  • SDN, NFV, 컨테이너와 같은 신기술이 대용량 데이터 시스템의 성능과 효율성에 미치는 영향을 평가하는 것.
  • 응용 프로그램, 네트워킹, 데이터센터 계층 전반의 최적화 기법에 대한 체계적인 리뷰를 제공하는 것.
  • 확장성 있고 에너지 효율적이며 고성능인 대용량 데이터 시스템을 위한 클라우드 인fra에서의 연구 격차와 향후 방향성 강조하기

제안 방법

  • 클라우드 데이터센터 및 네트워크에서 대용량 데이터 및 머신러닝 최적화에 관한 기존 문헌에 대한 체계적 검토.
  • 최적화 연구를 응용 프로그램 수준, 네트워킹 수준, 데이터센터 수준의 최적화로 3개 범주로 분류.
  • MapReduce, Hadoop, SDN, NFV, 가상 머신, 컨테이너, 데이터센터 토폴로지 등을 포함한 핵심 기술 분석.
  • 다양한 워크로드에서 작업 완료 시간, 공정성, 비용, 수익, 에너지 소비 등의 성능 메트릭 평가.
  • 실세계 프로토타입 및 클라우드 테스트베드에서의 시뮬레이션 기반 및 실험 결과 통합.
  • 분산 및 지리적으로 분산된 프레임워크에서 성능, 에너지 효율성, 자원 활용 간의 트레이드오프 식별.

실험 결과

연구 질문

  • RQ1대용량 데이터 워크로드는 트래픽, 지연, 자원 활용도 측면에서 클라우드 데이터센터 및 네트워크 성능에 어떻게 영향을 미치는가?
  • RQ2클라우드 스택의 응용 프로그램, 네트워크, 데이터센터 계층에서 대용량 데이터 기반 머신러닝 응용 프로그램 최적화에 있어 핵심 과제는 무엇인가?
  • RQ3SDN, NFV, 컨테이너와 같은 신기술은 대용량 데이터 시스템의 에너지 효율성과 성능을 어떻게 향상시킬 수 있는가?
  • RQ4다중 테넌시 및 지리적으로 분산된 대용량 데이터 환경에서 성능, 비용, 에너지 소비 간의 트레이드오프는 무엇인가?
  • RQ5클라우드 인fra에서 확장성 있고 공정하며 에너지 효율적인 대용량 데이터 처리를 달성하기 위한 열린 연구 과제는 무엇인가?

주요 결과

  • 에너지 효율성과 성능는 종종 상충 관계에 있으며, 대부분의 제공업체가 에너지 소비를 최소화하기보다는 SLA를 충족하기 위해 오버프로비저닝을 선호한다.
  • SDN과 NFV는 동적이고 응용 프로그램 인식 네트워크 및 자원 관리를 가능하게 하여 작업 완료 시간을 단축시키고 에너지 효율성을 향상시킨다.
  • 다중 테넌시는 공유된 네트워크 및 I/O 자원으로 인해 공정성과 격리 과제를 야기하며, 이에 따라 동적 스케줄링 및 가격 책정 모델이 필요하다.
  • 지리적으로 분산된 프레임워크는 높은 지연과 데이터 전송 비용을 겪으며, 이에 따라 새로운 라우팅 및 자원 할당 전략이 필요하다.
  • 이질적인 클러스터는 작업 완료 시간의 불균형을 유발하므로 정확한 프로파일링과 지능적인 스케줄링 알고리즘 필요.
  • 컨테이너 기반 기술과 가상화는 특히 동적이고 대규모 데이터센터 환경에서 자원 활용도와 유연성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.