Skip to main content
QUICK REVIEW

[논문 리뷰] Storage Solutions for Big Data Systems: A Qualitative Study and Comparison

Samiya Khan, Xiufeng Liu|arXiv (Cornell University)|2019. 04. 25.
Cloud Computing and Resource Management참고 문헌 143인용 수 6
한 줄 요약

이 논문은 문서 지향, 키-값, 그래프, 넓은 열 등 NoSQL 데이터 모델 간의 정성적 비교를 수행하며, Hadoop 환경에서의 대용량 데이터 파일 포맷을 평가한다. 데이터 특성과 워크로드에 기반한 스토리지 시스템 선택을 위한 핵심 설계 기준을 규명하고, 대용량 데이터 시스템에서 최적의 스토리지 및 파일 포맷을 선택하는 체계적인 프레임워크를 제시한다.

ABSTRACT

Big data systems development is full of challenges in view of the variety of application areas and domains that this technology promises to serve. Typically, fundamental design decisions involved in big data systems design include choosing appropriate storage and computing infrastructures. In this age of heterogeneous systems that integrate different technologies for optimized solution to a specific real world problem, big data system are not an exception to any such rule. As far as the storage aspect of any big data system is concerned, the primary facet in this regard is a storage infrastructure and NoSQL seems to be the right technology that fulfills its requirements. However, every big data application has variable data characteristics and thus, the corresponding data fits into a different data model. This paper presents feature and use case analysis and comparison of the four main data models namely document oriented, key value, graph and wide column. Moreover, a feature analysis of 80 NoSQL solutions has been provided, elaborating on the criteria and points that a developer must consider while making a possible choice. Typically, big data storage needs to communicate with the execution engine and other processing and visualization technologies to create a comprehensive solution. This brings forth second facet of big data storage, big data file formats, into picture. The second half of the research paper compares the advantages, shortcomings and possible use cases of available big data file formats for Hadoop, which is the foundation for most big data computing technologies. Decentralized storage and blockchain are seen as the next generation of big data storage and its challenges and future prospects have also been discussed.

연구 동기 및 목표

  • 다양한 대용량 워크로드에 적합한 특성과 적합성을 기반으로 문서 지향, 키-값, 그래프, 넓은 열 등 네 가지 주요 NoSQL 데이터 모델을 분석하고 비교한다.
  • 확장성, 일致성, 쿼리 지원 등 핵심 기준을 바탕으로 80개의 NoSQL 데이터베이스 솔루션을 평가하여 시스템 설계 의사결정을 안내한다.
  • Hadoop 생태계에서 사용되는 대용량 데이터 파일 포맷(예: Parquet, ORC, Avro)을 검토하고, 성능, 압축 효율성, 분석에 대한 적합성 면에서 평가한다.
  • 탈중앙화된 스토리지와 블록체인을 대용량 데이터 스토리지의 신개념 패러다임으로 탐색하며, 도전 과제와 향후 잠재력에 대해 논의한다.
  • 특정 대용량 데이터 애플리케이션 요구사항에 맞게 맞춤형으로 설계된 스토리지 인프라와 파일 포맷 선택을 위한 종합적인 决책 프레임워크를 제공한다.

제안 방법

  • 데이터 모델 유연성, 확장성, 쿼리 기능 등 기준을 바탕으로 네 가지 주요 NoSQL 데이터 모델 간의 기능 기반 비교 분석을 수행한다.
  • 일致성 모델, 데이터 분포, 지원되는 작업 등 구현 특성에 기반해 80개의 NoSQL 데이터베이스 시스템을 조사하고 분류한다.
  • Parquet, ORC, Avro, RCFile 등 대용량 데이터 파일 포맷을 압축 효율성, 열 기반 vs. 행 기반 스토리지, Hadoop 기반 처리 파이프라인에서의 성능 측면에서 평가한다.
  • 스토리지 시스템과 실행 엔진(Spark, Hive 등) 및 시각화 도구 간의 통합 요구사항을 평가하여 종단 간 데이터 파이프라인의 효율성을 확보한다.
  • 탈중앙화된 스토리지와 블록체인 기술을 차세대 스토리지 솔루션으로 탐색하며, 대용량 데이터 환경에서의 잠재력과 한계를 분석한다.
  • 결과를 종합하여 애플리케이션 특화의 데이터 특성과 워크로드 패턴에 기반한 스토리지 및 파일 포맷 선택을 위한 의사결정 프레임워크를 수립한다.

실험 결과

연구 질문

  • RQ1데이터 구조와 액세스 패턴에 기반해 특정 대용량 워크로드에 가장 적합한 NoSQL 데이터 모델은 문서 지향, 키-값, 그래프, 넓은 열 중 어느 것인가?
  • RQ280개의 NoSQL 데이터베이스 솔루션 간의 주요 기술적 및 아키텍처적 차이점은 무엇이며, 이는 시스템 설계 선택에 어떤 영향을 미치는가?
  • RQ3Hadoop 환경에서 성능, 압축, 쿼리 효율성 측면에서 서로 다른 대용량 데이터 파일 포맷(예: Parquet, ORC)은 어떻게 비교될 수 있는가?
  • RQ4탈중앙화된 스토리지와 블록체인은 대용량 데이터 스토리지 시스템 맥락에서 어떤 도전 과제와 기회를 안고 있는가?
  • RQ5처리 및 시각화 컴포onent과의 시스템적 통합을 통해 스토리지 및 파일 포맷 선택을 어떻게 체계적으로 맞출 수 있는가?

주요 결과

  • 문서 지향 스토리지와 넓은 열 스토리지 시스템은 스키마의 유연성과 높은 쓰기 처리량을 강력하게 지원하여 반구조화된 데이터 및 대규모 데이터 워크로드에 이상적이다.
  • 키-값 스토리지 시스템은 저지연, 고처리량 액세스 패턴에서 뛰어난 성능을 보이며, 특히 캐싱 및 세션 관리 시나리오에서 유리하다.
  • 그래프 데이터베이스는 사회망 분석이나 추천 시스템과 같은 복잡한 관계 중심 쿼리에서 뛰어난 성능을 발휘한다.
  • Parquet 및 ORC와 같은 열 기반 파일 포맷은 효율적인 조건 푸시다운과 열 기반 압축 덕분에 분석 워크로드에서 행 기반 포맷보다 뛰어난 성능을 보인다.
  • 파일 포맷 선택은 쿼리 실행 시간과 스토리지 효율성에 명백한 영향을 미치며, 대부분의 분석 벤치마크에서 Parquet가 더 뛰어난 성능을 보였다.
  • 탈중앙화된 스토리지와 블록체인은 신뢰성과 감사 가능성을 위한 유망한 해결책을 제시하지만, 현재는 생산적 대용량 데이터 시스템에서 확장성과 성능의 한계를 겪고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.