Skip to main content
QUICK REVIEW

[논문 리뷰] Towards an Integrated Platform for Big Data Analysis

Mahdi Bohlouli, Frank Schulz|arXiv (Cornell University)|2020. 04. 27.
Cloud Computing and Resource Management참고 문헌 20인용 수 22
한 줄 요약

이 논문은 데이터 관리, 처리, 분석 및 시각화를 하나의 확장 가능한 시스템으로 통합하는 통합 빅데이터 분석 플랫폼을 제안한다. 이러한 구성 요소들을 공동 설계함으로써 자원 효율성, 알고리즘 파rameter화 및 종단 간 사용성 향상을 달성하여 기존 빅데이터 워크로드를 위한 점별 솔루션에서 나타나는 분산 문제를 해결한다.

ABSTRACT

The amount of data in the world is expanding rapidly. Every day, huge amounts of data are created by scientific experiments, companies, and end users' activities. These large data sets have been labeled as "Big Data", and their storage, processing and analysis presents a plethora of new challenges to computer science researchers and IT professionals. In addition to efficient data management, additional complexity arises from dealing with semi-structured or unstructured data, and from time critical processing requirements. In order to understand these massive amounts of data, advanced visualization and data exploration techniques are required. Innovative approaches to these challenges have been developed during recent years, and continue to be a hot topic for re-search and industry in the future. An investigation of current approaches reveals that usually only one or two aspects are ad-dressed, either in the data management, processing, analysis or visualization. This paper presents the vision of an integrated plat-form for big data analysis that combines all these aspects. Main benefits of this approach are an enhanced scalability of the whole platform, a better parameterization of algorithms, a more efficient usage of system resources, and an improved usability during the end-to-end data analysis process.

연구 동기 및 목표

  • 과학적, 기업적, 사용자 생성 데이터 소스에서 오는 막대하고 이질적인 데이터를 분석하는 데 증가하는 도전 과제를 해결하기 위해.
  • 기존 시스템이 빅데이터 처리의 오직 한두 가지 측면에 집중하는 데서 비롯되는 한계를 극복하기 위해.
  • 전체 데이터 분석 파이프라인 전반에서 확장성, 자원 효율성, 사용성을 향상시키는 통합 플랫폼을 설계하기 위해.
  • 데이터 처리 및 분석 구성 요소의 밀접한 통합을 통해 알고리즘 파arameter화와 시스템 자원 활용도를 향상시키기 위해.

제안 방법

  • 데이터 수신, 저장, 처리, 분석 및 시각화 구성 요소를 하나의 플랫폼으로 통합하는 통합 아키텍처 비전을 제안한다.
  • 다양한 데이터 유형과 워크로드 간의 확장성과 상호운용성을 지원하기 위해 구성 요소 수준의 모ularity를 활용한다.
  • 실시간 또는 거의 실시간 분석을 가능하게 하기 위해 머신러닝 파이프라인을 데이터 처리 레이어에 직접 통합한다.
  • 데이터 특성과 사용자 요구 사항에 따라 처리 워크플로우를 동적으로 조정하기 위해 메타데이터 기반 오케스트레이션을 사용한다.
  • 대화형 데이터 탐색과 통찰 발견을 지원하기 위해 파이프라인 초기 단계에서 시각화 기법을 적용한다.
  • 시간에 민감하고 고용량의 데이터 워크로드를 처리하기 위해 분산 컴퓨팅 원칙을 활용해 수평적 확장성을 설계한다.

실험 결과

연구 질문

  • RQ1데이터 관리, 처리, 분석 및 시각화를 어떻게 종합적으로 하나의 플랫폼에 통합하여 종단 간 데이터 분석을 향상시킬 수 있는가?
  • RQ2빅데이터 플랫폼에서 더 나은 확장성과 자원 활용도를 달성하는 데 도움이 되는 아키텍처 패턴은 무엇인가?
  • RQ3시스템 전체의 데이터 및 워크로드 특성에 대한 인식을 통해 알고리즘 파arameter화는 어떻게 향상될 수 있는가?
  • RQ4빅데이터 분석 과정에서 대화형 및 지속적인 시각화는 사용성 향상과 통찰 발견에 어떤 역할을 하는가?
  • RQ5통합 플랫폼은 빅데이터 파이프라인에서 여러 점별 도구를 오케스트레이션하는 데서 기인하는 복잡성과 오버헤드를 줄일 수 있는가?

주요 결과

  • 통합 플랫폼은 워크로드 인식 실행을 위해 데이터 처리 및 분석 구성 요소를 공동 설계함으로써 확장성 향상을 달성한다.
  • 시스템 전체의 맥락 인식을 통해 알고리즘의 파arameter화가 향상되어 수동 튜닝 노력이 감소한다.
  • 파이프라인 전반에서 데이터 이동, 계산 및 시각화 워크로드 간의 조율을 통해 자원 활용도가 향상된다.
  • 분석 과정의 초기 단계에서 대화형 데이터 탐색과 시각화를 가능하게 함으로써 사용성이 향상된다.
  • 점별 도구와 미들웨어의 필요성이 줄어들어 데이터 워크플로우가 단순화되고 통합 오버헤드가 최소화된다.
  • 반구조적 및 비구조적 데이터를 저지연 처리 요구 사항과 함께 지원하는 통합 아키텍처의 실현 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.