Skip to main content
QUICK REVIEW

[論文レビュー] Big Data Model "Entity and Features"

Nataliya Shakhovska, Uyrii Bolubash|arXiv (Cornell University)|May 3, 2019
Graph Theory and Algorithms参考文献 7被引用数 8
ひとこと要約

本論文は、事前に統合を行わずに異種で動的なデータソースを統合する課題に対処するため、'エンティティと特徴' Big Data モデルを提案する。エンティティとその特徴を独立してモデル化することにより、フレームワークはデータソース間の類似度測定と距離計算を効率的に行い、非正規化および準正規化データを扱う分散型 NoSQL ベースの環境における意思決定を支援する。

ABSTRACT

The article deals with the problem which led to Big Data. Big Data information technology is the set of methods and means of processing different types of structured and unstructured dynamic large amounts of data for their analysis and use of decision support. Features of NoSQL databases and categories are described. The developed Big Data Model "Entity and Features" allows determining the distance between the sources of data on the availability of information about a particular entity. The information structure of Big Data has been devised. It became a basis for further research and for concentrating on a problem of development of diverse data without their preliminary integration.

研究の動機と目的

  • 事前のデータ統合やスキーマ整合を要しない、多様で動的かつ異種の Big Data ソース統合の課題に対処すること。
  • NoSQL 環境における構造化および非構造化データをサポートするスケーラブルな情報モデルを開発すること。
  • 共有されるエンティティ特徴に基づいて、データソース間の有効な比較および類似度検出を可能にすること。
  • 分散型データ処理および特徴ベースのデータマッチングに関する今後の研究の基盤を提供すること。
  • データの多様性を保ちながら、クロスソース分析を可能にする意思決定支援システムを支援すること。

提案手法

  • データの意味論をストレージ構造から分離するため、'エンティティ' と '特徴' を原子的抽象単位とする概念的データモデルを提案すること。
  • 特徴をエンティティに関連付ける属性または記述子として定義し、構造化および非構造化データタイプの両方をサポートすること。
  • データソースをエンティティおよびそれらに関連する特徴の集合としてモデル化し、特徴レベルでのソース間比較を可能にすること。
  • 特徴の重なりと類似度メトリクスを用いて、データソース間の距離を計算し、情報の近接度を定量化すること。
  • NoSQL データベースと互換性を持たせ、分散型でスケーラブルかつ柔軟なデータ処理を可能にするモデルを設計すること。
  • エンティティ-特徴関係のグラフ的表現を活用し、効率的な照会および類似度計算を実現すること。

実験結果

リサーチクエスチョン

  • RQ1事前の統合やスキーマ整合を要せず、構造が異種な Big Data ソースをどのように比較できるか?
  • RQ2どのような概念的モデルが、NoSQL 環境における多様なデータタイプにわたるエンティティおよびその特徴の有効な表現を可能にするか?
  • RQ3共有される特徴に基づいて、データソース間の類似度または距離をどのように定量的に測定できるか?
  • RQ4特徴ベースのモデリングは、分散型で大規模なデータシステムにおける意思決定支援にどのように寄与するか?
  • RQ5提案されたモデルは、データの多様性を保ちながら、どのようにクロスソース分析および統合を可能にするか?

主な発見

  • 'エンティティと特徴' モデルは、エンティティデータとその特徴記述子を明確に分離し、モジュラーでスケーラブルなデータモデリングを実現した。
  • このモデルは構造化および非構造化データの両方をサポートしており、幅広い Big Data ワークロードに適用可能である。
  • 特徴の重なりを用いた距離計算が可能であり、データ類似度の定量的測定が実現された。
  • データ統合を要せず、データの完全性および多様性を保ちながら意思決定支援が可能になった。
  • フレームワークは NoSQL データベースと互換性があり、分散型、並列処理、クラスタコンピューティング環境をサポートする。
  • 本アプローチは、今後の特徴ベースのデータマッチングおよび分散型データ分析に関する研究の基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。