Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized formal model of big data

Nataliya Shakhovska, Oleh Veres|arXiv (Cornell University)|2019. 05. 04.
Big Data and Business Intelligence참고 문헌 8인용 수 5
한 줄 요약

이 논문은 기존의 전통적 비즈니스 분석과 구분되는 빅데이터 기술의 핵심 특성을 체계화하는 일반화된 형식적 모델을 제안한다. 이는 분산 스토리지(예: GFS, HBase)와 처리 프레임워크(예: MapReduce, Hadoop)를 통합하며, 빅데이터 시스템의 구조적 및 기능적 구성 요소를 형식화하여 의료 및 물류와 같은 분야에서 확장 가능한 데이터 관리 및 분석을 지원한다.

ABSTRACT

This article dwells on the basic characteristic features of the Big Data technologies. It is analyzed the existing definition of the "big data" term. The article proposes and describes the elements of the generalized formal model of big data. It is analyzed the peculiarities of the application of the proposed model components. It described the fundamental differences between Big Data technology and business analytics. Big Data is supported by the distributed file system Google File System technology, Cassandra, HBase, Lustre and ZFS, by the MapReduce and Hadoop programming constructs and many other solutions. According to the experts, such as McKinsey Institute, the manufacturing, healthcare, trade, administration and control of individual movements undergo the transformations under the influence of the Big Data.

연구 동기 및 목표

  • 기존의 5V 모델을 초월하여 빅데이터 기술의 기본 특성을 형식화하기 위해.
  • 빅데이터와 비즈니스 분석 간의 개념적 및 기술적 차이를 명확히 하기 위해.
  • 분산 스토리지 및 처리 시스템의 구성 요소를 통합하는 일반화된 형식적 모델을 개발하기 위해.
  • 의료, 무역, 물류와 같은 다양한 분야에서 모델 구성 요소의 적용 가능성을 분석하기 위해.
  • Hadoop, Cassandra, HBase와 같은 기술을 활용한 확장 가능한 데이터 관리에 대한 이론적 기반을 제공하기 위해.

제안 방법

  • 분산 데이터 시스템의 구조적 및 기능적 구성 요소를 바탕으로 한 빅데이터의 일반화된 형식적 모델을 제안한다.
  • Google File System(GFS), HBase, Cassandra, Lustre, ZFS와 같은 핵심 기술을 기반 스토리지 계층으로 통합한다.
  • MapReduce와 Hadoop을 분산 데이터 처리를 위한 핵심 프로그래밍 추상화로 통합한다.
  • 데이터 수집, 스토리지, 처리, 분석 워크플로우의 형식적 분해를 통해 모델의 구성 요소를 정의한다.
  • 의료, 물류와 같은 도메인 특화 사례 연구를 통해 모델의 적용 가능성과 확장성을 검증한다.
  • 데이터 양, 속도, 처리 아키텍처를 바탕으로 빅데이터와 전통적 비즈니스 분석을 구분하는 개념적 프레임워크를 수립한다.

실험 결과

연구 질문

  • RQ1일반화된 형식적 빅데이터 모델을 정의하는 데 핵심이 되는 구조적 및 기능적 구성 요소는 무엇인가?
  • RQ2GFS, HBase, Cassandra와 같은 분산 스토리지 시스템은 빅데이터 시스템의 확장성에 어떻게 기여하는가?
  • RQ3제안된 모델은 빅데이터 처리를 전통적 비즈니스 분석과 어떻게 구별하는가?
  • RQ4고속도, 고용량 데이터 워크로드를 지원하기 위한 주요 아키텍처 원칙은 무엇인가?
  • RQ5의료 및 물류와 같은 실제 도메인에 대해 형식적 모델을 어떻게 적용하여 확장성과 성능을 보장할 수 있는가?

주요 결과

  • 일반화된 형식적 모델은 Hadoop, MapReduce, 분산 파일 시스템과 같은 핵심 기술을 통합하여 통합된 개념적 프레임워크를 성공적으로 구현한다.
  • 모델은 배치 중심의 중앙집중식 분석과는 대비되어 실시간, 확장 가능하고 분산 처리를 강조함으로써 빅데이터 시스템과 비즈니스 분석 간의 명확한 차이를 부각시킨다.
  • GFS, HBase, Cassandra와 같은 분산 스토리지 기술은 모델 내에서 데이터 지속성과 장애 내성의 핵심 수단으로 기능한다.
  • 모델은 데이터 파이프라인의 모듈화된 분해를 통해 고속도 데이터 처리를 지원하여 시스템의 유지보수성과 성능을 향상시킨다.
  • 의료 및 물류와 같은 분야에 모델을 적용한 결과, 이질적인 데이터 환경에서도 모델의 적응 가능성과 확장성의 가능성을 입증한다.
  • 형식적 모델은 향후 빅데이터 아키텍처, 시스템 설계, 다중 도메인 데이터 통합 분야의 연구에 이론적 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.