Skip to main content
QUICK REVIEW

[논문 리뷰] Identifying Dwarfs Workloads in Big Data Analytics

Wanling Gao, Chunjie Luo|arXiv (Cornell University)|2015. 05. 26.
Cloud Computing and Resource Management참고 문헌 18인용 수 4
한 줄 요약

이 논문은 검색, 소셜 네트워크, 전자상거래, 생물정보학, 멀티미디어, 천문학 등 다양한 분야의 알고리즘 40개에 대한 다중 도메인 분석을 통해 빅데이터 분석에서 핵심적인 역할을 하는 여덟 가지 기본적인 워크로드—선형 대수, 샘플링, 논리 연산, 변환 연산, 집합 연산, 그래프 연산, 통계 연산, 정렬—을 규명한다. 검색, 소셜 네트워크, 전자상거래, 생물정보학, 멀티미디어, 천문학 등의 분야에서 반복적으로 나타나는 계산 패턴을 추상화함으로써, 빅데이터 시스템의 효율적이고 종합적인 평가를 가능하게 하는 최소한의 대표성 있는 벤치마크 세트를 구축한다.

ABSTRACT

Big data benchmarking is particularly important and provides applicable yardsticks for evaluating booming big data systems. However, wide coverage and great complexity of big data computing impose big challenges on big data benchmarking. How can we construct a benchmark suite using a minimum set of units of computation to represent diversity of big data analytics workloads? Big data dwarfs are abstractions of extracting frequently appearing operations in big data computing. One dwarf represents one unit of computation, and big data workloads are decomposed into one or more dwarfs. Furthermore, dwarfs workloads rather than vast real workloads are more cost-efficient and representative to evaluate big data systems. In this paper, we extensively investigate six most important or emerging application domains i.e. search engine, social network, e-commerce, multimedia, bioinformatics and astronomy. After analyzing forty representative algorithms, we single out eight dwarfs workloads in big data analytics other than OLAP, which are linear algebra, sampling, logic operations, transform operations, set operations, graph operations, statistic operations and sort.

연구 동기 및 목표

  • 다양하고 복잡하며 빠르게 변화하는 빅데이터 워크로드를 최소한의 대표성 있는 계산 단위로 평가하는 데 도전하는 것.
  • 주요 빅데이터 애플리케이션 도메인 전반에서 핵심적인 운영을 반영하는 최소한의 계산 추상화(워크로드) 집합을 규명하는 것.
  • 실제 알고리즘과 프레임워크에서 자주 나타나는 계산 패턴을 체계적으로 추출하는 방법론을 개발하는 것.
  • 이러한 워크로드를 기반으로 한 대표성 있고 비용 효율적인 벤치마크 세트(빅데이터벤치 3.1)를 구축하여 빅데이터 시스템 평가를 가능하게 하는 것.
  • 빅데이터 분석에서 시스템 평가, 아키텍처 설계, 성능 최적화의 기초를 마련하는 것.

제안 방법

  • 커버리지와 관련성 기준으로 검색 엔진, 소셜 네트워크, 전자상거래, 멀티미디어, 생물정보학, 천문학 등 여섯 가지 핵심 응용 도메인을 선정.
  • Mahout, MLlib 등의 널리 사용되는 라이브러리, Spark, Hadoop 등의 프레임워크, BigBench, AMP 벤치마크 등의 벤치마크에서 유래한 40개의 대표적 알고리즘을 분석.
  • 구조적, 반구조적, 비구조적 데이터 모델 전반에서 반복되는 패턴을 식별함으로써 알고리즘을 분해하고 자주 나타나는 계산 연산을 추출.
  • 워크로드를 표현하기 위해 방향성 없는 사이클 그래프(DAG)-유사 모델을 사용하며, 정점은 데이터 서브셋, 간선은 워크로드로 정의하여 조합 가능성과 커버리지 검증.
  • 원래의 40개 알고리즘을 워크로드 연산의 조합을 통해 재구성함으로써 여덟 개의 워크로드가 갖는 표현력과 완전성을 검증.
  • 실제 14개 데이터셋과 33개 워크로드를 포함한 오픈소스 벤치마크 세트인 빅데이터벤치 3.1을 개발하여, 식별된 워크로드에 기반한 대표성 있는 평가 프레임워크 제공.

실험 결과

연구 질문

  • RQ1다양한 빅데이터 분석 워크로드 전반에서 자주 나타나는 핵심적인 계산 단위는 무엇인가?
  • RQ2실제 알고리즘과 프레임워크에서 체계적으로 유도 가능한 최소한의 계산 추상화(워크로드) 집합은 어떻게 도출할 수 있는가?
  • RQ3식별된 워크로드가 여러 도메인에 걸쳐 빅데이터 분석의 계산 다양성을 얼마나 잘 반영하는가?
  • RQ4일반적인 수준의 추상화인 NRC 일곱 마스터와 비교할 때, 제안된 워크로드는 분할의 정도와 대표성 측면에서 어떤가?
  • RQ5이러한 워크로드를 기반으로 한 벤치마크 세트는 전체적인 복잡한 워크로드에 의존하지 않고도 빅데이터 시스템을 효과적이고 효율적으로 평가할 수 있는가?

주요 결과

  • 저자들은 빅데이터 분석에서 여덟 가지 핵심 워크로드를 규명했다: 선형 대수, 샘플링, 논리 연산, 변환 연산, 집합 연산, 그래프 연산, 통계 연산, 정렬.
  • 이 워크로드들은 여섯 가지 주요 응용 도메인에서 분석한 40개의 대표적 알고리즘을 통해 도출되었으며, 광범위한 커버리지와 대표성을 확보했다.
  • 이 워크로드들은 DAG 유사 조합 모델을 통해 원래의 40개 알고리즘을 재구성할 수 있으며, 이는 표현력과 완전성의 우수함을 입증한다.
  • NRC 일곱 마스터보다 더 낮은 추상화 수준에 있으며, 고수준의 수학 문제보다 원자적인 계산 단위에 집중함으로써 더 세밀한 시스템 평가가 가능하다.
  • 제안된 워크로드는 기계 학습, 데이터 마이닝, NLP, 그래프 처리 분야의 핵심 운영을 포함하며, 최적화, 유사도 검색, 확률적 추론의 핵심 구성요소를 포함한다.
  • 결과적으로 공개된 빅데이터벤치 3.1 벤치마크 세트는 14개의 실세계 데이터셋과 33개의 워크로드를 포함하며, 모두 식별된 워크로드에 기반하여, 확장 가능하고 대표성 있는 평가 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.