Skip to main content
QUICK REVIEW

[論文レビュー] MapSDI: A Scaled-up Semantic Data Integration Framework for Knowledge Graph Creation

Samaneh Jozashoori, María-Esther Vidal|arXiv (Cornell University)|Sep 3, 2019
Semantic Web and Ontologies参考文献 13被引用数 17
ひとこと要約

MapSDI は、RML などのマッピングルールを用いて、RDF化の前段階で異種で大規模なデータセットを前処理することで、知識グラフ作成を最適化するスケーラブルな意味的データ統合フレームワークです。関連する属性を抽出し、重複を除去することで、RDF化の前処理段階でデータ量を削減します。マッピングルールに埋め込まれた意味的知識と関係代数の性質を活用することで、MapSDI は RDFizer の実行時間を最大で1桁短縮し、データ損失なしに、高ボリューム、多様性、信頼性の高いビッグデータ処理において顕著なパフォーマンス向上を実現します。

ABSTRACT

Semantic web technologies have significantly contributed with effective solutions for the problems of data integration and knowledge graph creation. However, with the rapid growth of big data in diverse domains, different interoperability issues still demand to be addressed, being scalability one of the main challenges. In this paper, we address the problem of knowledge graph creation at scale and provide MapSDI, a mapping rule-based framework for optimizing semantic data integration into knowledge graphs. MapSDI allows for the semantic enrichment of large-sized, heterogeneous, and potentially low-quality data efficiently. The input of MapSDI is a set of data sources and mapping rules being generated by a mapping language such as RML. First, MapSDI pre-processes the sources based on semantic information extracted from mapping rules, by performing basic database operators; it projects out required attributes, eliminates duplicates, and selects relevant entries. All these operators are defined based on the knowledge encoded by the mapping rules which will be then used by the semantification engine (or RDFizer) to produce a knowledge graph. We have empirically studied the impact of MapSDI on existing RDFizers, and observed that knowledge graph creation time can be reduced on average in one order of magnitude. It is also shown, theoretically, that the sources and rules transformations provided by MapSDI are data-lossless.

研究の動機と目的

  • 高ボリューム、多様性、信頼性の高いビッグデータを対象とした知識グラフ作成における意味的データ統合のスケーラビリティ課題に対処すること。
  • RMLmapper や SDM-RDFizer などの既存の RDFizer が引き起こす重複データと非効率な処理によるパフォーマンスのオーバーヘッドを低減すること。
  • マッピングルールにエンコードされた意味的知識を活用して、入力データセットの効率的かつ損失なしの前処理を可能にすること。
  • スキーマレベル統合とデータレベル統合を統合した最適化パイプラインを提供し、高コストな後処理ステップを回避すること。

提案手法

  • MapSDI は、RML などのマッピングルールを用いて必要な属性を特定し、入力データセットに対して意味的知見に基づいた前処理を実施します。
  • ルールの意味論に基づき、関係代数の演算(射影と選択)を適用することで、RDF化の前段階でデータサイズを削減します。
  • 射影と選択をデータ処理パイプラインにプッシュダウンすることで、RDFizer の入力ボリュームを最小限に抑えます。
  • マッピングルールで定義された属性セットに基づいて重複削除を実施し、パイプラインの初期段階でデータの重複を早期に低減します。
  • RDF三元組の正しく生成するために必要なすべての意味的情報を保持することで、データ損失なしの変換を保証します。
  • 実世界のバイオメディカルデータセットを用いて評価し、既存の RDFizer(RMLmapper、SDM-RDFizer)と統合して、パフォーマンス向上を測定しました。

実験結果

リサーチクエスチョン

  • RQ1マッピングルールに埋め込まれた意味的知識を用いた入力データの前処理が、知識グラフ作成における RDFizer 実行時間の顕著な短縮をもたらすか。
  • RQ2MapSDI のデータ損失なしの前処理は、大規模で異種的かつ低品質なデータセットに対して、既存の RDFizer のスケーラビリティにどのように影響するか。
  • RQ3RML 三元組マップを介して複数のデータセットを結合する際、属性の射影と重複削除がパフォーマンスにどの程度向上効果をもたらすか。
  • RQ4MapSDI は、基盤となるマッピング言語や RDFizer に依存せずに適用可能か。また、異なるツール間で一貫したパフォーマンス向上を達成できるか。

主な発見

  • MapSDI は、複数のテストデータセットにおいて、平均で最大1桁(10倍)の RDFizer 実行時間短縮を達成しました。
  • 100%の重複率を持つデータセットに対して前処理を実施した結果、入力データセットのサイズが 235,000 KB から 997 KB にまで 98%削減され、パフォーマンスが顕著に向上しました。
  • 高い重複率(最大100%)であっても、MapSDI は安定したパフォーマンスを維持しますが、ベースラインフレームワーク(T-framework)はデータボリュームと重複率の増加に伴い実行時間が増加する傾向を示しました。
  • MapSDI により、従来 500 秒でタイムアウトしていた SDM-RDFizer の結合処理が正常に完了するようになり、複雑なマッピング条件下でもスケーラビリティが向上しました。
  • 理論的分析により、MapSDI の前処理ステップがデータ損失なしであることが確認され、最終的な知識グラフが元の統合パイプラインと意味的に同一であることが保証されました。
  • 実験的結果から、使用する RDFizer にかかわらず、MapSDI はベースラインシステムを常に上回り、データサイズや重複率の変動に関わらず一貫したパフォーマンス向上を示しました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。