Skip to main content
QUICK REVIEW

[논문 리뷰] Big Data: Understanding Big Data

Kevin Taylor-Sakyi|arXiv (Cornell University)|2016. 01. 15.
Cloud Computing and Resource Management참고 문헌 11인용 수 8
한 줄 요약

이 논문은 대규모 데이터의 기초 개념, 데이터 저장 도전 과제, 그리고 대규모 데이터셋을 처리하기 위한 MapReduce 프로그래밍 모델에 중점을 두어 빅데이터에 대한 종합적인 개요를 제공한다. 두 개의 사례 연구를 통해 빅데이터 분석의 실용적 가치를 입증하며, 데이터 라이프사이클, 개인정보 보호, 표현 문제에 주의를 기울일 경우 경쟁 우위와 사회적 복리에 기여할 잠재력을 강조한다.

ABSTRACT

Steve Jobs, one of the greatest visionaries of our time was quoted in 1996 saying "a lot of times, people do not know what they want until you show it to them" [38] indicating he advocated products to be developed based on human intuition rather than research. With the advancements of mobile devices, social networks and the Internet of Things, enormous amounts of complex data, both structured and unstructured are being captured in hope to allow organizations to make better business decisions as data is now vital for an organizations success. These enormous amounts of data are referred to as Big Data, which enables a competitive advantage over rivals when processed and analyzed appropriately. However Big Data Analytics has a few concerns including Management of Data-lifecycle, Privacy & Security, and Data Representation. This paper reviews the fundamental concept of Big Data, the Data Storage domain, the MapReduce programming paradigm used in processing these large datasets, and focuses on two case studies showing the effectiveness of Big Data Analytics and presents how it could be of greater good in the future if handled appropriately.

연구 동기 및 목표

  • 현대의 데이터 집약적 시스템의 맥락에서 빅데이터의 核심 개념과 과제를 명확히 하기 위해.
  • 확장 가능한 데이터 처리를 가능하게 하는 데이터 저장 및 MapReduce 파라다임의 역할을 검토하기 위해.
  • 실제 사례 연구를 통해 빅데이터 분석의 효과성을 평가하기 위해.
  • 데이터 라이프사이클 관리, 개인정보 보호, 데이터 표현과 같은 핵심 우려 사항을 식별하기 위해.
  • 책임감 있는 방식으로 처리될 경우 빅데이터가 보다 넓은 사회적 복리에 어떻게 기여할 수 있는지 탐색하기 위해.

제안 방법

  • 논문은 데이터 양, 속도, 다양성, 신뢰성과 같은 빅데이터의 기본 개념을 검토한다.
  • 대규모 비정형 및 반정형 데이터를 처리하기 위한 데이터 저장 아키텍처를 분석한다.
  • 분산 데이터 처리의 핵심 파라다임으로서 MapReduce 프로그래밍 모델을 설명한다.
  • 실제 환경에서의 빅데이터 분석 응용 사례를 보여주기 위해 두 개의 사례 연구를 제시한다.
  • 데이터 라이프사이클 관리, 개인정보 보호, 데이터 표현을 핵심 운영적 과제로 논의한다.
  • 지식 공간 이론의 통찰을 통합하여 빅데이터 시스템 내의 모순과 과제를 프레임워크화한다.

실험 결과

연구 질문

  • RQ1빅데이터 분석은 현대 기업에서 어떤 방식으로 경쟁 우위를 제공할 수 있는가?
  • RQ2라이프사이클, 개인정보 보호, 표현과 같은 요소를 포함한 대규모 데이터를 관리하는 데 있어 주요 기술적 및 관리적 과제는 무엇인가?
  • RQ3MapReduce 모델은 분산 시스템에서 빅데이터를 효율적으로 처리하는 데 어떻게 기여하는가?
  • RQ4사례 연구를 통해 실제 환경에서 빅데이터는 어떤 방식으로 효과적으로 적용될 수 있는가?
  • RQ5사회적 복리에 기여하기 위해 사용될 경우 빅데이터의 윤리적 및 체계적 영향은 무엇인가?

주요 결과

  • 빅데이터 분석은 방대하고 복잡한 데이터셋을 활용함으로써 조직이 더 나은 비즈니스 결정을 내리는 데 기여한다.
  • MapReduce 모델은 분산 환경에서 대규모 데이터를 처리하기 위한 확장 가능하고 효율적인 프레임워크를 제공한다.
  • 적절한 데이터 라이프사이클 관리는 데이터 품질, 접근성, 비용 효율성을 확보하기 위해 필수적이다.
  • 개인정보 보호 및 보안 문제는 빅데이터 시스템의 광범위하고 책임감 있는 도입을 방해하는 주요 장벽으로 남아 있다.
  • 사례 연구는 빅데이터가 올바르게 구현될 경우 실용적 응용 분야에서 측정 가능한 가치를 제공할 수 있음을 입증한다.
  • 데이터 표현 문제, 즉 일관성 결여와 의미 모호성은 분석 정확성과 의사결정을 약화시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.