Skip to main content
QUICK REVIEW

[논문 리뷰] Big Data Analytics in Cloud environment using Hadoop

Mansaf Alam, Kashish Ara Shakil|arXiv (Cornell University)|2016. 09. 15.
Cloud Computing and Resource Management참고 문헌 4인용 수 4
한 줄 요약

이 논문은 대용량 데이터의 볼륨, 속도, 다양성, 가치라는 도전 과제를 해결하기 위해 Hadoop를 활용한 클라우드 기반 대용량 데이터 분석 프레임워크를 제안한다. 이 프레임워크는 이러한 네 가지 V에 따라 데이터를 분류하고 전용 처리 노드로 라우팅하며, Hadoop의 분산 저장 및 MapReduce 기능을 활용해 확장 가능하고 병렬 처리가 가능한 방식으로 처리한다. 최종적으로 처리 결과를 통합하여 통합 출력을 생성한다. 이는 다양한 대용량 데이터 워크로드를 처리하는 데 있어 효율성이 향상됨을 보여준다.

ABSTRACT

The Big Data management is a problem right now. The Big Data growth is very high. It is very difficult to manage due to various characteristics. This manuscript focuses on Big Data analytics in cloud environment using Hadoop. We have classified the Big Data according to its characteristics like Volume, Value, Variety and Velocity. We have made various nodes to process the data based on their volume, velocity, value and variety. In this work we have classify the input data and routed to various processing node. At the last after processing from each node, we can combine the output of all nodes to get the final result. We have used Hadoop to partition the data as well as process it.

연구 동기 및 목표

  • 고용량, 고속도, 다양성, 가치가 높은 특징을 지닌 대용량 데이터를 관리하는 데 증가하는 도전 과제를 해결하기 위해.
  • 데이터의 특성에 따라 동적으로 전용 처리 노드로 데이터를 라우팅할 수 있는 확장 가능한 분석 프레임워크를 설계하기 위해.
  • 클라우드 환경에서의 데이터 분할 및 병렬 처리를 위한 효율적인 Hadoop의 분산 컴퓨팅 모델을 활용하기 위해.
  • 다양한 전용 처리 노드에서의 출력 결과를 통합하여 최종 결과를 하나의 통합된 출력으로 만드는 데 목적이 있다.
  • 이질적인 클라우드 기반 워크로드에서 대용량 데이터 분석의 성능과 적응 가능성 향상을 위해.

제안 방법

  • 데이터는 네 가지 V: 볼륨, 속도, 다양성, 가치에 따라 처리 노드로 분류된다.
  • Hadoop의 HDFS는 분산된 노드 간 데이터 저장 및 분할에 사용된다.
  • MapReduce는 각 노드에서 데이터 세그먼트를 병렬 처리할 수 있도록 구현된다.
  • 각 처리 노드는 해당 데이터 유형의 특성에 맞게 처리하여 계산을 최적화한다.
  • 개별 처리 후 모든 노드의 결과가 집계되어 최종 출력이 생성된다.
  • 이 아키텍처는 클라우드 환경에서 다양한 데이터 유형과 워크로드를 처리하기 위한 확장성과 유연성을 지원한다.

실험 결과

연구 질문

  • RQ1다양한 특징(볼륨, 속도, 다양성, 가치)을 지닌 대용량 데이터 워크로드가 클라우드 환경에서 어떻게 효율적으로 처리될 수 있는가?
  • RQ2데이터의 속성에 따라 전용 처리 노드로 동적으로 데이터를 라우팅할 수 있는 아키텍처는 무엇인가?
  • RQ3Hadoop의 분산 모델을 사용할 경우 대용량 데이터 분석의 확장성과 성능이 어떻게 향상되는가?
  • RQ4네 가지 V에 따라 데이터를 분류하는 것이 처리 효율성과 결과 정확성에 미치는 영향은 무엇인가?
  • RQ5여러 전용 처리 노드에서 생성된 출력 결과는 어떻게 효과적으로 통합되어 하나의 통합된 결과로 만들어지는가?

주요 결과

  • 제안된 프레임워크는 네 가지 V에 따라 대용량 데이터를 전용 처리 노드로 분류하여 타겟팅된 효율적인 처리를 가능하게 했다.
  • Hadoop의 HDFS 및 MapReduce 구성 요소는 분산 노드 간 데이터 분할 및 병렬 실행을 효과적으로 지원한다.
  • 모듈러 아키텍처는 클라우드 환경에서 다양한 데이터 유형의 확장 가능하고 확장 가능한 처리를 가능하게 한다.
  • 여러 전용 노드에서의 결과 집계는 통합되고 정확한 최종 출력을 생성한다.
  • 단일 모듈 기반 처리 모델에 비해 이질적인 대용량 데이터 워크로드를 처리하는 데 있어 더 높은 적응성과 성능 향상을 보였다.
  • Hadoop를 활용한 클라우드 기반 대용량 데이터 분석 솔루션으로서의 시스템의 타당성이 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.