Skip to main content
QUICK REVIEW

[논문 리뷰] The Anatomy of Big Data Computing

Raghavendra Kune, Pramod Kumar Konugurthi|arXiv (Cornell University)|2015. 09. 04.
Big Data Technologies and Applications참고 문헌 33인용 수 4
한 줄 요약

이 논문은 확장성과 성능 도전 과제를 해결하기 위해 클라우드 인fra를 빅데이터 클라우드에 통합하여 빅데이터 컴퓨팅을 위한 종합적인 분류 체계와 계층적 아키텍처를 제시한다. 핵심 구성요소, 기술, 워크로드를 설명하면서 분산 환경에서의 데이터 쿠레이션, 처리, 분석 분야의 열린 과제를 규명하며 대규모 데이터 분석 분야의 향후 연구 및 시스템 설계를 위한 기초 프레임워크를 제공한다.

ABSTRACT

Advances in information technology and its widespread growth in several areas of business, engineering, medical and scientific studies are resulting in information/data explosion. Knowledge discovery and decision making from such rapidly growing voluminous data is a challenging task in terms of data organization and processing, which is an emerging trend known as Big Data Computing; a new paradigm which combines large scale compute, new data intensive techniques and mathematical models to build data analytics. Big Data computing demands a huge storage and computing for data curation and processing that could be delivered from on-premise or clouds infrastructures. This paper discusses the evolution of Big Data computing, differences between traditional data warehousing and Big Data, taxonomy of Big Data computing and underpinning technologies, integrated platform of Big Data and Clouds known as Big Data Clouds, layered architecture and components of Big Data Cloud and finally discusses open technical challenges and future directions.

연구 동기 및 목표

  • 기존 데이터 웨어하우징과 비교하여 빅데이터 컴퓨팅의 진화 과정과 구분되는 특징을 분석하기 위해.
  • 데이터 유형, 처리 모델, 워크로드를 포함한 빅데이터 컴퓨팅의 분류 체계를 정의하기 위해.
  • 빅데이터와 클라우드 컴퓨팅을 통합한 플랫폼인 빅데이터 클라우드를 제안하기 위해.
  • 빅데이터 클라우드를 위한 계층적 아키텍처 모델을 개략적으로 제시하고 구성요소 및 상호작용를 상세히 기술하기 위해.
  • 확장 가능한 데이터 처리 및 분석 분야에서의 열린 기술적 과제와 향후 연구 방향을 규명하기 위해.

제안 방법

  • 논문은 빅데이터 컴퓨팅과 기존 데이터 웨어하우징 간의 비교 분석을 수행하여 데이터 양, 속도, 다양성 및 처리 패러다임의 차이점을 부각한다.
  • 구조화된, 반구조화된, 비구조화된 데이터 유형, 배치, 스트림, 인터랙티브 처리 모델, 분석, 머신러닝, ETL 워크로드를 기반으로 빅데이터 컴퓨팅의 분류 체계를 제안한다.
  • 클라우드 인fra와 빅데이터 기술을 통합하여 탄력적이고 확장 가능한 데이터 처리를 가능하게 하는 빅데이터 클라우드의 개념을 도입한다.
  • 다섯 계층의 아키텍처를 정의한다: (1) 데이터 수집, (2) 데이터 저장, (3) 데이터 처리, (4) 데이터 분석, (5) 애플리케이션 인터페이스.
  • 각 아키텍처 계층에서의 역할을 분석하기 위해 하둡, 스파크, NoSQL 데이터베이스, 클라우드 플랫폼(예: AWS, 오픈스택) 등의 기반 기술을 평가한다.
  • 기존 연구와 산업 실무를 통합하여 데이터 쿠레이션, 장애 내성, 실시간 처리 분야의 지속적인 기술적 과제를 규명한다.

실험 결과

연구 질문

  • RQ1빅데이터 컴퓨팅은 데이터 특성과 처리 요구사항 측면에서 기존 데이터 웨어하우징과 근본적으로 어떻게 다릅니까?
  • RQ2확장 가능한 빅데이터 클라우드 플랫폼을 구성하는 핵심 구성요소와 아키텍처 계층은 무엇입니까?
  • RQ3빅데이터 시스템에서 효율적인 데이터 쿠레이션과 분석을 가능하게 하는 핵심 기술과 수학적 모델은 무엇입니까?
  • RQ4분산 빅데이터 환경에서 고성능, 장애 내성, 실시간 데이터 처리를 달성하기 위해 가장 큰 열린 과제는 무엇입니까?
  • RQ5빅데이터와 클라우드 컴퓨팅의 통합을 발전시키기 위해 필요한 향후 연구 방향은 무엇입니까?

주요 결과

  • 논문은 빅데이터 컴퓨팅이 높은 데이터 양, 빠른 속도, 다양한 데이터 유형을 특징으로 하며, 기존 데이터 웨어하우징을 넘어서는 새로운 처리 모델이 필요하다고 규명한다.
  • 제안된 빅데이터 클라우드 플랫폼은 클라우드 인프라와 빅데이터 프레임워크를 통합함으로써 동적 자원 할당과 탄력적 확장을 가능하게 한다.
  • 다섯 계층의 아키텍처는 빅데이터 시스템 구성요소를 효과적으로 조직하며, 데이터 수집부터 애플리케이션 노출에 이르기까지 명확한 기능 분리가 이루어진다.
  • 하둡은 배치 처리의 기초 기술로, 스파크는 실시간 처리의 기초 기술로 식별되며, NoSQL 데이터베이스는 유연한 스키마 처리를 지원한다.
  • 열린 과제로는 효율적인 데이터 쿠레이션, 분산 환경에서의 장애 내성, 스트리밍 워크로드를 위한 저지연 처리가 있다.
  • 연구는 향후 발전이 데이터 분석 파이프라인 최적화, 상호운용성 향상, 빅데이터 시스템의 보안 및 프라이버시 강화에 집중해야 한다고 결론 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.