Skip to main content
QUICK REVIEW

[論文レビュー] Mapping XML Data to Relational Data: A DOM-Based Approach

Mustafa Atay, Yezhou Sun|arXiv (Cornell University)|Oct 8, 2010
Advanced Database Systems and Queries参考文献 12被引用数 13
ひとこと要約

本稿では、DOMベースのアプローチを用いてXMLデータをリレーショナルデータベースにマッピングする線形時間アルゴリズムであるXInsertを提案する。DOMツリーを走査し、インライン化に基づくスキーママッピングを適用することで、XML INSERT文をSQL INSERT文のシーケンスに効率的に変換し、n個のXML要素および属性に対してO(n)の時間計算量を達成する。

ABSTRACT

XML has emerged as the standard for representing and exchanging data on the World Wide Web. It is critical to have efficient mechanisms to store and query XML data to exploit the full power of this new technology. Several researchers have proposed to use relational databases to store and query XML data. While several algorithms of schema mapping and query mapping have been proposed, the problem of mapping XML data to relational data, i.e., mapping an XML INSERT statement to a sequence of SQL INSERT statements, has not been addressed thoroughly in the literature. In this paper, we propose an efficient linear algorithm for mapping XML data to relational data. This algorithm is based on our previous proposed inlining algorithm for mapping DTDs to relational schemas and can be easily adapted to other inlining algorithms.

研究の動機と目的

  • XMLからリレーショナルデータベースへのマッピングという未だ十分に検討されていない問題に取り組むこと、特にXML INSERT文をSQL INSERT文に変換すること。
  • 既存のスキーママッピング技術、特にインライン化に基づくアプローチと連携して動作する効率的なアルゴリズムを開発すること。
  • DOMツリー走査を活用することで、大規模なXMLドキュメントに対してもスケーラブルで高い性能を発揮するデータマッピングプロセスを確保すること。
  • 著者のDTDMapにとどまらず、さまざまなインライン化に基づくスキーママッピングアルゴリズムに適応可能な基盤を提供すること。

提案手法

  • XMLドキュメントをメモリ上にツリー構造として表現するため、ドキュメントオブジェクトモデル(DOM)を用いる。
  • 二段階のアルゴリズムを適用する:第一段階ではインライン化不能な要素を特定し処理し、第二段階ではインライン化可能な要素を再帰的走査で処理する。
  • 各XML要素を関係型テーブルに一度だけキューイングすることで、重複を防ぎ、挿入時の参照整合性を維持する。
  • 過去のスキーママッピング(例:DTDMap)で用いられたインライン化技術を活用し、テーブル数を削減し、ジョイン操作を最小限に抑える。
  • インライン化不能な要素を処理するためのwhileループと、インライン化可能な要素を処理するための別のwhileループを用い、両方とも線形時間で動作する。
  • 各DOMノードが正確に一度だけ訪問されることを保証し、nがXML要素および属性の合計数である場合にO(n)の時間計算量を達成する。

実験結果

リサーチクエスチョン

  • RQ1DOMベースのアプローチを用いて、XMLデータをリレーショナルデータベースに効率的にマッピングする方法は何か?
  • RQ2DOM走査とインライン化を用いるデータマッピングアルゴリズムの時間計算量は何か?
  • RQ3XMLドキュメントサイズの増加に伴い、提案されたアルゴリズムの性能はどのように変化するか?
  • RQ4文書中心型(document-centric)とデータ中心型(data-centric)の異なる構造的特徴を示すXMLドキュメントにおいて、アルゴリズムの性能はどのように変化するか?

主な発見

  • XInsertアルゴリズムは、nがXML要素および属性の数である場合にO(n)の時間計算量を達成し、線形かつ非常に効率的である。
  • 本アルゴリズムは、データ中心型(catalog.dtd)および文書中心型(auction.dtd)の両方のXMLドキュメントで良好に動作し、一貫した線形スケーリングを示す。
  • 40 MBを超えるドキュメントサイズでは、メモリ制限のため、DOMツリーが主記憶を超えてディスクスワップを必要とし、性能劣化が発生する。
  • 深くネストされた再帰的テキスト要素を含むauction.dtdドキュメントは、特に50 MBのサイズで処理に時間がかかり、catalog.dtdよりも長時間要する。
  • DTDMapや共有インライン化(shared-inlining)を含むさまざまなスキーママッピング方式に対しても、アルゴリズムの性能は安定的かつ予測可能である。
  • 本アルゴリズムは、他のインライン化に基づくスキーママッピング技術に対しても容易に適応可能であり、再利用性と拡張性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。