Skip to main content
QUICK REVIEW

[논문 리뷰] A Tale of Two Data-Intensive Paradigms: Applications, Abstractions, and Architectures

Shantenu Jha, Judy Qiu|arXiv (Cornell University)|2014. 03. 06.
Cloud Computing and Resource Management참고 문헌 25인용 수 5
한 줄 요약

이 논문은 빅데이터 오그리(Big Data Ogres) 개념을 사용하여 고성능 컴퓨팅(HPC)과 Apache Hadoop 기반 시스템이라는 두 가지 주요 데이터 집약적 컴퓨팅 패러다임을 비교하는 프레임워크를 제안한다. 빅데이터 오그리로 워크로드를 분류하고 성능을 벤치마킹한다. 연구 결과 HPC(MPI)는 K-means 클러스터링에서 빠른 실행 속도를 보이며 Hadoop(Spark)를 능가하지만, Hadoop는 더 뛰어난 추상화와 확장성 덕분에 두 생태계의 최고의 요소를 융합하기 위해 상호운용성 있는 라이브러리인 SPIDAL을 통해 융합을 주장한다.

ABSTRACT

Scientific problems that depend on processing large amounts of data require overcoming challenges in multiple areas: managing large-scale data distribution, co-placement and scheduling of data with compute resources, and storing and transferring large volumes of data. We analyze the ecosystems of the two prominent paradigms for data-intensive applications, hereafter referred to as the high-performance computing and the Apache-Hadoop paradigm. We propose a basis, common terminology and functional factors upon which to analyze the two approaches of both paradigms. We discuss the concept of "Big Data Ogres" and their facets as means of understanding and characterizing the most common application workloads found across the two paradigms. We then discuss the salient features of the two paradigms, and compare and contrast the two approaches. Specifically, we examine common implementation/approaches of these paradigms, shed light upon the reasons for their current "architecture" and discuss some typical workloads that utilize them. In spite of the significant software distinctions, we believe there is architectural similarity. We discuss the potential integration of different implementations, across the different levels and components. Our comparison progresses from a fully qualitative examination of the two paradigms, to a semi-quantitative methodology. We use a simple and broadly used Ogre (K-means clustering), characterize its performance on a range of representative platforms, covering several implementations from both paradigms. Our experiments provide an insight into the relative strengths of the two paradigms. We propose that the set of Ogres will serve as a benchmark to evaluate the two paradigms along different dimensions.

연구 동기 및 목표

  • HPC와 Apache Hadoop 기반의 데이터 집약적 컴퓨팅 패러다임을 비교하기 위한 통합 개념적 프레임워크를 수립하기 위해.
  • 빅데이터 오그리(Big Data Ogres) 모델을 사용하여 반복적인 데이터 집약적 응용 패턴을 식별하고 분류하기 위해.
  • 실험적 벤치마킹을 통해 성능, 추상화, 확장성 측면에서 HPC와 Hadoop의 상대적 강점을 평가하기 위해.
  • 특히 공통된 추상화와 런타임 지원을 통해 HPC와 Hadoop 생태계 간의 상호운용성 및 융합 가능성을 탐색하기 위해.
  • 두 패러다임의 기능을 통합하는 통합형 상호운용성 빅데이터 분석 라이브러리(SPIDAL) 개발을 제안하기 위해.

제안 방법

  • HPC와 Hadoop 생태계에서 공통적인 데이터 집약적 워크로드를 분류하고 분석하기 위해 '빅데이터 오그리(Big Data Ogres)'를 개념적 벤치마킹 프레임워크로 도입한다.
  • HPC(MPI)와 Hadoop(Spark) 구현 간의 실행 성능를 비교하기 위해 K-means 클러스터링을 대표적인 마이크로 벤치마크로 사용한다.
  • 경직된 성능 지표(실행 시간)와 부드러운 요소(추상화, 표현력, 확장성, 소프트웨어 공학)를 결합한 반정량적 방법론을 적용한다.
  • 런타임, 통신, 자원 관리, 물리적 자원 등의 아키텍처 계층을 두 패러다임 모두에 대해 분석하여 기능적 및 구현적 차이를 규명한다.
  • HPC의 피LOT-작업 추상화를 YARN에 확장하고, 데이터 국소성 인식 스케줄링을 위한 Pilot-Data를 활용하여 이중 패러다임 간의 상호운용성을 가능하게 한다.
  • HPC와 Hadoop 기능을 통합하는 프로토타입으로서 확장 가능한 병렬 상호운용성 빅데이터 분석 라이브러리(SPIDAL)를 개발한다.

실험 결과

연구 질문

  • RQ1HPC와 Hadoop 기반 시스템의 핵심 계층에서 계산 및 데이터 관리 측면에서의 功能 추상화와 아키텍처 설계는 어떻게 다릅니까?
  • RQ2대표적인 데이터 집약적 워크로드인 K-means 클러스터링에 대해 HPC(MPI)와 Hadoop(Spark) 간의 성능 상충 관계는 어떻게 됩니까?
  • RQ3현대적인 Hadoop 프레임워크인 Spark는 집합 연산과 메모리 기반 계산과 같은 HPC 기법을 어느 정도 도입하고 있습니까?
  • RQ4HPC와 Hadoop 생태계 간의 상호운용성에 대한 주요 장벽은 무엇이며, 어떻게 극복할 수 있습니까?
  • RQ5HPC와 Hadoop 간의 추상화 및 기능 격차를 메울 수 있는 통합형 상호운용성 빅데이터 분석 라이브러리를 설계할 수 있습니까?

주요 결과

  • MPI 기반의 K-means 실행은 Spark 기반 구현보다 뚜렷이 빠르며, Spark는 불변 RDD 추상화로 인해 더 많은 메모리 복사가 필요하다.
  • 낮은 원시 성능에도 불구하고 Spark는 고수준 추상화와 더 나은 표현력을 제공하여 저수준 통신 프리미티브의 필요성을 줄이고 개발자 생산성을 향상시킨다.
  • Hadoop 프레임워크인 Spark는 효율적인 집합 연산과 같은 HPC 영감을 받은 최적화를 도입하여 HPC 시스템과의 성능 격차를 좁히고 있다.
  • Apache Hadoop 생태계는 HPC 생태계보다 기능적 폭과 확장성 면에서 훨씬 뛰어난 110개 이상의 소프트웨어 구현을 제공한다.
  • YARN의 애플리케이션 수준 스케줄링 지원은 이질적 워크로드 관리를 가능하게 하지만, HPC 자원 패브릭과의 완전한 통합은 아직 제한되어 있다.
  • 제안된 SPIDAL 라이브러리는 HPC 애플리케이션에 Hadoop의 풍부한 빅데이터 분석 기능을 제공하면서도 HPC의 성능과 저수준 제어를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.