Skip to main content
QUICK REVIEW

[논문 리뷰] Big Data Model "Entity and Features"

Nataliya Shakhovska, Uyrii Bolubash|arXiv (Cornell University)|2019. 05. 03.
Graph Theory and Algorithms참고 문헌 7인용 수 8
한 줄 요약

이 논문은 사전 통합이 필요 없는 이질적이고 동적 데이터 소스 통합 문제를 해결하기 위해 '엔티티와 특징' 빅데이터 모델을 제안한다. 엔티티와 그 특징을 별도로 모델링함으로써, 프레임워크는 데이터 소스 간의 유사도 측정과 거리 계산을 효율적으로 가능하게 하여, 비정형 및 반구조적 데이터를 포함한 분산형 NoSQL 기반 환경에서의 의사결정 지원을 가능하게 한다.

ABSTRACT

The article deals with the problem which led to Big Data. Big Data information technology is the set of methods and means of processing different types of structured and unstructured dynamic large amounts of data for their analysis and use of decision support. Features of NoSQL databases and categories are described. The developed Big Data Model "Entity and Features" allows determining the distance between the sources of data on the availability of information about a particular entity. The information structure of Big Data has been devised. It became a basis for further research and for concentrating on a problem of development of diverse data without their preliminary integration.

연구 동기 및 목표

  • 사전 데이터 융합이나 스키마 정렬이 필요하지 않은 다양한, 동적이고 이질적인 빅데이터 소스 통합 문제를 해결한다.
  • NoSQL 환경에서 구조화된 데이터와 비구조화된 데이터를 모두 지원하는 확장 가능한 정보 모델을 개발한다.
  • 공유 엔티티 특징을 바탕으로 데이터 소스 간의 효과적인 비교 및 유사도 탐지 기능을 제공한다.
  • 분산형 데이터 처리 및 특징 기반 데이터 매칭 분야의 향후 연구 기반을 마련한다.
  • 데이터 다양성을 유지하면서도 다중 소스 분석을 가능하게 함으로써 의사결정 지원 시스템을 지원한다.

제안 방법

  • 데이터 의미 체계를 스토리지 구조에서 분리하기 위해 '엔티티'와 '특징'을 원자적 추상 단위로 삼는 개념적 데이터 모델을 제안한다.
  • 특징을 엔티티와 관련된 속성 또는 묘사자료로 정의하며, 이는 구조화된 데이터 유형과 비구조화된 데이터 유형을 모두 지원한다.
  • 데이터 소스를 엔티티와 그 관련 특징의 집합으로 모델링하여, 소스 간 특징 수준의 비교를 가능하게 한다.
  • 특징 겹침과 유사도 메트릭을 활용해 데이터 소스 간의 거리를 계산함으로써 정보적 유사도를 정량화한다.
  • NoSQL 데이터베이스와의 호환성을 확보하여 분산형, 확장 가능하고 유연한 데이터 처리를 지원하도록 모델을 설계한다.
  • 엔티티-특징 관계를 그래프 유사 표현으로 구현하여 효율적인 질의 처리 및 유사도 계산을 가능하게 한다.

실험 결과

연구 질문

  • RQ1사전 통합이나 스키마 정렬 없이도 이질적인 구조를 가진 빅데이터 소스는 어떻게 비교할 수 있는가?
  • RQ2어떤 개념적 모델이 NoSQL 환경에서 다양한 데이터 유형 간 엔티티와 그 특징을 효과적으로 표현할 수 있는가?
  • RQ3공유 특징을 바탕으로 데이터 소스 간의 유사도 또는 거리를 정량적으로 측정하는 방법은 무엇인가?
  • RQ4특징 기반 모델링은 분산형 대규모 데이터 시스템에서 의사결정 지원을 뒷받침하는 데 어떤 역할을 하는가?
  • RQ5제안된 모델은 다중 소스 분석 및 통합을 가능하게 하면서도 데이터 다양성을 어떻게 유지하는가?

주요 결과

  • '엔티티와 특징' 모델은 엔티티 데이터와 그 특징 기술자 간의 분리를 성공적으로 구현하여 모듈화되고 확장 가능한 데이터 모델링을 가능하게 한다.
  • 이 모델은 구조화된 데이터와 비구조화된 데이터를 모두 지원하여 다양한 빅데이터 워크로드에 적용 가능하다.
  • 특징 겹침을 통한 거리 계산이 가능하여 데이터 유사도를 정량적으로 측정할 수 있다.
  • 데이터 통합을 요구하지 않음으로써 데이터 무결성과 다양성을 유지하면서도 의사결정 지원을 가능하게 한다.
  • 이 프레임워크는 NoSQL 데이터베이스와 호환되며 분산형, 병렬형, 클러스터 컴퓨팅 환경을 지원한다.
  • 이 접근법은 향후 특징 기반 데이터 매칭 및 분산형 데이터 분석 분야의 연구 기반을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.