Skip to main content
QUICK REVIEW

[논문 리뷰] BDGS: A Scalable Big Data Generator Suite in Big Data Benchmarking

Zijian Ming, Chunjie Luo|arXiv (Cornell University)|2014. 01. 22.
Data Quality and Management참고 문헌 19인용 수 12
한 줄 요약

BDGS는 실제 세계의 데이터 모델을 활용하여 빅데이터의 4V 특성—용량, 속도, 다양성, 신뢰성—을 유지하는 합성 데이터를 생성하기 위해 설계된 확장 가능한 빅데이터 생성기 세트이다. 이는 텍스트, 그래프, 테이블 소스에서 구조화된, 반구조화된, 비구조화된 데이터를 모두 지원하며, 다양한 워크로드에서 데이터 생성 시간에 대해 선형 확장성을 달성하고 일관된 고속 생성 속도(예: 텍스트의 경우 71.3 MB/s, 그래프의 경우 591,684 엣지/s)를 유지를 한다.

ABSTRACT

Data generation is a key issue in big data benchmarking that aims to generate application-specific data sets to meet the 4V requirements of big data. Specifically, big data generators need to generate scalable data (Volume) of different types (Variety) under controllable generation rates (Velocity) while keeping the important characteristics of raw data (Veracity). This gives rise to various new challenges about how we design generators efficiently and successfully. To date, most existing techniques can only generate limited types of data and support specific big data systems such as Hadoop. Hence we develop a tool, called Big Data Generator Suite (BDGS), to efficiently generate scalable big data while employing data models derived from real data to preserve data veracity. The effectiveness of BDGS is demonstrated by developing six data generators covering three representative data types (structured, semi-structured and unstructured) and three data sources (text, graph, and table data).

연구 동기 및 목표

  • 벤치마킹을 위한 실제 데이터 특성을 유지하는 응용 프로그램 중심의 확장 가능한 빅데이터를 생성하는 데 도전하는 것.
  • Hadoop와 같은 특정 데이터 유형이나 플랫폼만 지원하는 기존 생성기의 한계를 극복하는 것.
  • 실제 세계의 데이터 모델링을 통해 데이터 용량과 속도에 대한 탄력적인 제어를 가능하게 하면서도 데이터의 신뢰성을 유지하는 것.
  • 검색 엔진, 전자상거래, 소셜 네트워크와 같은 다양한 분야의 빅데이터 워크로드를 지원하는 것.
  • 실제 데이터의 통계적 및 구조적 특성을 반영하는 합성 데이터를 생성하기 위한 모듈식이고 확장 가능한 프레임워크를 제공하는 것.

제안 방법

  • 실제 세계의 텍스트, 그래프, 테이블 소스에서 유래한 데이터 세트를 기반으로 하여 데이터의 정확성을 확보하기 위해 여섯 개의 데이터 생성기로 구성된 세트를 설계하는 것.
  • 하드웨어 용량과 실행 시간에 따라 데이터 용량과 속도를 확장하기 위해 병렬 생성 전략을 구현하는 것.
  • 분포, 구조, 관계와 같은 핵심 특성을 유지하기 위해 실제 데이터에서 유도된 통계 모델을 사용하는 것.
  • Hadoop와 Spark와 같은 주요 빅데이터 시스템 간의 상호 운용성을 지원하기 위해 데이터 형식 변환 도구를 통합하는 것.
  • 다양한 데이터 유형과 용량에서 일관된 생성 속도를 유지하기 위해 메모리 사용량과 병렬 처리를 최적화하는 것.
  • 광범위한 접근성과 통합을 위해 오픈소스 BigDataBench 프레임워크 내부에 생성기 세트를 통합하는 것.

실험 결과

연구 질문

  • RQ1실제 빅데이터의 4V 특성—용량, 속도, 다양성, 신뢰성—을 유지하는 빅데이터 생성기 세트는 어떻게 설계할 수 있는가?
  • RQ2어떤 기법이 다양한 데이터 유형(구조화된, 반구조화된, 비구조화된)과 소스(텍스트, 그래프, 테이블) 간에 확장 가능하고 고성능의 데이터 생성을 가능하게 하는가?
  • RQ3데이터 용량이 증가함에 따라 합성 데이터 생성의 성능 속도가 일관성 있게 유지되는 정도는 어느 정도인가?
  • RQ4메모리 사용량은 데이터 생성 성능에 어떤 영향을 미치며, 각 생성기 유형에서의 성능 저하 요인은 무엇인가?
  • RQ5동일한 생성기를 빅데이터 벤치마킹의 여러 워크로드에서 효과적으로 재사용할 수 있는가?

주요 결과

  • BDGS 세트는 데이터 용량 증가에 따라 선형적인 총 시간 성능을 달성하여 모든 생성기 유형에서 확장성을 입증한다.
  • 텍스트 생성기는 사전 크기에 따라 아마존 영화 리뷰의 경우 평균 생성 속도가 71.3 MB/s이며, 위키백과 데이터의 경우 63.23 MB/s이다.
  • 그래프 생성기는 충분한 메모리가 확보된 경우 최소 591,684 엣지/초의 속도를 유지하지만, 높은 메모리 요구량으로 인해 가장 느린 편이다.
  • 테이블 생성기는 23.85 MB/s의 속도를 달성하며, 더 큰 용량에서 평균 설정 시간이 감소함에 따라 효율성이 향상된다.
  • 실험에서 메모리 사용률이 90%를 초과하여, 특히 텍스트 및 그래프 생성기에서 메모리가 주요 성능 저하 요인임을 나타낸다.
  • 다양한 데이터 유형과 용량에서 데이터 생성 속도가 거의 일정하게 유지됨을 확인하여, 시스템의 안정성과 확장성은 입증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.