Skip to main content
QUICK REVIEW

[논문 리뷰] A Taxonomy on Big Data: Survey

Ripon Patgiri|arXiv (Cornell University)|2018. 08. 25.
Big Data Technologies and Applications인용 수 4
한 줄 요약

이 논문은 빅데이터를 일곱 핵심 분야로 체계적으로 분류하는 종합적인 분류 체계를 제안한다: 의미론, 계산 인프라, 스토리지 시스템, 빅데이터 관리, 마이닝, 머신러닝, 보안 및 프라이버시. 이는 특성(V3+11), 아키텍처(MapReduce, BSP, 스트리밍), 스토리지 모델, 보안 도전 과제를 체계적으로 분석하여 다양한 분야에서 빅데이터 기술과 그 응용을 이해하기 위한 체계적인 프레임워크를 제공한다.

ABSTRACT

The Big Data is the most popular paradigm nowadays and it has almost no untouched area. For instance, science, engineering, economics, business, social science, and government. The Big Data are used to boost up the organization performance using massive amount of dataset. The Data are assets of the organization, and these data gives revenue to the organizations. Therefore, the Big Data is spawning everywhere to enhance the organizations' revenue. Thus, many new technologies emerging based on Big Data. In this paper, we present the taxonomy of Big Data. Besides, we present in-depth insight on the Big Data paradigm.

연구 동기 및 목표

  • 필드의 점증하는 복잡성과 분열을 해결하기 위해 빅데이터에 대한 통합적이고 다차원적인 분류 체계를 수립하기 위해.
  • 기존의 3V 모델을 초월하여 빅데이터의 진화하는 특성들을 분석하고, 볼륨, 속도, 다양성, 신뢰성, 유효성, 가치, 가상, 시각화, 변동성, 수취인, 세라믹용기, 복잡성 등을 포함한 11개의 V를 통합한 모델을 제시하기 위해.
  • MapReduce, 대량 동기 병렬(BSP), 스트리밍 모델을 포함한 빅데이터 인프라의 핵심 기술들을 분류하고 분석하기 위해.
  • 빅데이터 시스템의 인프라, 데이터, 관리, 무결성 차원에서의 보안 및 프라이버시 도전 과제를 조사하기 위해.
  • 실세계 응용 분야에서 빅데이터 기술과 머신러닝 및 분석의 통합을 위한 종합적인 개요를 제공하기 위해.

제안 방법

  • 7개 카테고리의 분류 체계 제안: 의미론, 계산 인프라, 스토리지 시스템, 빅데이터 관리, 마이닝, 머신러닝, 보안 및 프라이버시.
  • 빅데이터 특성 기준으로 사용된 V3+11 모델(볼륨, 속도, 다양성, 신뢰성, 유효성, 가치, 가상, 시각화, 변동성, 수취인, 세라믹용기, 복잡성)을 분석.
  • 계산 인프라를 세 가지 파라다임으로 분류: MapReduce, 대량 동기 병렬(BSP), 스트리밍 처리.
  • 스토리지 시스템을 네 가지 하위 구성요소로 분류: 스토리지 아키텍처, 구현, 구조, 장치.
  • 보안 및 프라이버시를 네 가지 차원으로 분석: 인프라 보안, 데이터 프라이버시, 데이터 관리, 데이터 무결성.
  • 머신러닝 및 데이터 마이닝 기법을 빅데이터 파이프라인에 통합하여, 히든 셀프 암호화 및 안전한 다자간 계산과 같은 프라이버시 보존 기법을 강조함.

실험 결과

연구 질문

  • RQ1빅데이터는 그 핵심 기술적 및 개념적 차원에서 어떻게 체계적으로 분류될 수 있는가?
  • RQ2기존의 3V 모델을 초월한 확장된 특성(예: 볼륨, 속도, 다양성, 신뢰성, 유효성, 가치, 가상, 시각화, 변동성, 수취인, 세라믹용기, 복잡성)은 현대 빅데이터를 어떻게 정의하며, 이는 시스템 설계에 어떤 영향을 미치는가?
  • RQ3MapReduce, BSP, 스트리밍과 같은 다양한 계산 인프라는 어떻게 확장 가능한 데이터 처리를 가능하게 하는가? 각각의 강점과 한계는 무엇인가?
  • RQ4빅데이터 시스템에서의 주요 보안 및 프라이버시 도전 과제는 무엇이며, 인프라, 데이터, 무결성 수준에서 어떻게 해결할 수 있는가?
  • RQ5머신러닝 및 프라이버시 보존 분석과 같은 신기술은 어떻게 빅데이터 플랫폼과 통합되어 기능성과 신뢰도를 향상시키는가?

주요 결과

  • 기존의 3V 모델에 비해 V3+11 모델은 빅데이터의 정밀성, 유효성, 가치, 복잡성과 같은 핵심 요소를 더 포괄적으로 반영하여 더 종합적인 프레임워크를 제공한다.
  • 장애 내성, 일반 하드웨어에서의 확장성, 병렬 처리 추상화 등으로 인해 MapReduce는 대규모 데이터 처리의 주요 파라다임으로 남아 있다.
  • 스트리밍과 BSP 모델은 각각 실시간 및 반복적 데이터 처리에 필수적이며, 저지연 시나리오에서 배치 중심의 MapReduce의 한계를 보완한다.
  • 빅데이터의 보안은 다층적 구조를 이루며, 인프라, 데이터, 무결성 도전 과제는 액세스 제어, 암호화(예: 히든 셀프 암호화), 기록 추적과 같은 통합 솔루션을 필요로 한다.
  • 데이터 기록 추적과 세밀한 감사 기능은 정밀 분석 및 규정 준수에 필수적이지만, 대규모 동적 데이터 라인재이 그래프로 인해 복잡성이 증가한다.
  • 안전한 다자간 계산 및 검증 가능한 계산과 같은 프라이버시 보존 기법은 기밀성을 훼손하지 않은 채 민감한 데이터 분석을 가능하게 하므로 필수적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.