Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Batch Processing: Towards Real-Time and Streaming Big Data

Saeed Shahrivari, Saeed Jalili|arXiv (Cornell University)|2014. 03. 13.
Cloud Computing and Resource Management참고 문헌 13인용 수 7
한 줄 요약

이 논문은 Hadoop의 배치 처리 모델에서 실시간 및 스트리밍 대용량 데이터 처리로의 전환을 제안하며, 실시간 및 스트리밍 처리 패러다임을 Hadoop의 대안으로 평가한다. 실증 실험을 통해 Apache Storm 및 Spark Streaming과 같은 시스템을 Hadoop와 비교하여, 인터랙티브 및 스트리밍 워크로드에 대해 더 낮은 지연 시간과 높은 효율성을 입증한다.

ABSTRACT

Today, big data is generated from many sources and there is a huge demand for storing, managing, processing, and querying on big data. The MapReduce model and its counterpart open source implementation Hadoop, has proven itself as the de facto solution to big data processing. Hadoop is inherently designed for batch and high throughput processing jobs. Although Hadoop is very suitable for batch jobs but there is an increasing demand for non-batch processes on big data like: interactive jobs, real-time queries, and big data streams. Since Hadoop is not proper for these non-batch workloads, new solutions are proposed to these new challenges. In this article, we discuss two categories of these solutions: real-time processing, and stream processing for big data. For each category, we discuss paradigms, strengths and differences to Hadoop. We also introduce some practical systems and frameworks for each category. Finally, some simple experiments are done to show effectiveness of some solutions compared to available Hadoop-based solutions.

연구 동기 및 목표

  • 기존의 배치 처리를 초월해 대용량 데이터의 저지연 처리에 대한 증가하는 수요를 해결한다.
  • Hadoop의 MapReduce 모델이 실시간 및 스트리밍 워크로드를 처리하는 데 가지는 한계를 규명한다.
  • Hadoop의 대안으로서의 새로운 실시간 및 스트리밍 처리 프레임워크를 평가하고 비교한다.
  • 실험을 통해 스트리밍 솔루션이 Hadoop 기반의 배치 처리보다 성능상의 우수성을 입증한다.

제안 방법

  • 배치, 실시간, 스트리밍 처리로 대용량 워크로드를 분류하여 각각의 처리 요구사항을 식별한다.
  • Hadoop(배치 중심)과 실시간/스트리밍 시스템(저지연, 지속적 처리) 간의 아키텍처적 차이를 분석한다.
  • 실시간 처리의 핵심 패러다임(예: 반복 계산)과 스트리밍 처리의 핵심 패러다임(예: 지속적 데이터 플로우 처리)을 검토한다.
  • Hadoop와 비교하여 실용적인 프레임워크인 Apache Storm(스트리밍) 및 Spark Streaming(마이크로배치 스트리밍)을 검토하고 비교한다.
  • Hadoop와 스트리밍 프레임워크 간의 종단 간 지연 시간과 처리량을 비교하기 위해 단순 실험을 설계하고 수행한다.
  • 유사한 워크로드 조건에서 지연 시간과 처리량 메트릭을 사용하여 시스템 성능을 평가한다.

실험 결과

연구 질문

  • RQ1Hadoop의 배치 처리 모델이 실시간 및 스트리밍 데이터 워크로드를 지원하는 데 있어 핵심적인 한계는 무엇인가?
  • RQ2Hadoop의 MapReduce와 비교할 때 실시간 및 스트리밍 처리 패러다임은 아키텍처와 사용 사례 적합성 측면에서 어떻게 다를까?
  • RQ3지연 시간과 처리량 측면에서 Hadoop와 현대적 스트리밍 프레임워크 간의 성능 트레이드오프는 어떠한가?
  • RQ4Spark Streaming 및 Apache Storm과 같은 스트리밍 프레임워크는 저지연 처리 시나리오에서 Hadoop를 능가할 수 있는가?
  • RQ5실시간 인사이트가 필요한 대용량 데이터 애플리케이션에 대해 스트리밍 시스템을 도입하는 데 실질적인 영향은 무엇인가?

주요 결과

  • Hadoop의 배치 처리 모델은 상당한 지연 시간을 유발하여 실시간 또는 인터랙티브 데이터 처리에 부적합하다.
  • Apache Storm 및 Spark Streaming과 같은 실시간 및 스트리밍 처리 프레임워크는 Hadoop보다 상당히 낮은 종단 간 지연 시간을 달성한다.
  • 실험적 평가 결과, 스트리밍 프레임워크가 지속적 데이터 처리 워크로드에서 더 뛰어난 성능을 보인다.
  • Spark Streaming은 마이크로배치 처리를 통해 효율성을 향상시켜 낮은 지연 시간과 높은 처리량을 균형 있게 유지한다.
  • 본 연구는 Hadoop가 밀리초 이내의 반응 시간이 요구되거나 지속적인 데이터 분석이 필요한 워크로드에 최적화되어 있지 않음을 확인한다.
  • 결과적으로, 사기 탐지 및 모니터링 시스템와 같은 실시간 분석이 필요한 애플리케이션에 대해 스트리밍 프레임워크의 도입을 지지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.