Skip to main content
QUICK REVIEW

[論文レビュー] Simple Schemas for Unordered XML

Iovka Boneva, Radu Ciucanu|arXiv (Cornell University)|Mar 18, 2013
Advanced Database Systems and Queries参考文献 21被引用数 8
ひとこと要約

本稿では、順序なしXMLのための軽量で人間が読みやすいスキーマ形式として、排他的多重性スキーマ(DMS)およびその制限形である排中なし多重性スキーマ(MS)を導入する。これらは、計算複雑性を増加させることなく、DTDの多くの表現力を保持する。主な貢献は、静的解析問題(例:スキーマの充足可能性、属性、包含関係、クエリ同等性)の形式的特徴付けであり、DMSおよびMSがコアタスクにおいて多項式時間の複雑性を維持しながら、現実のデータ指向XMLアプリケーションに見られる順序なしコンテンツモデルを正確にモデル化することを示している。

ABSTRACT

We consider unordered XML, where the relative order among siblings is ignored, and propose two simple yet practical schema formalisms: disjunctive multiplicity schemas (DMS), and its restriction, disjunction-free multiplicity schemas (MS). We investigate their computational properties and characterize the complexity of the following static analysis problems: schema satisfiability, membership of a tree to the language of a schema, schema containment, twig query satisfiability, implication, and containment in the presence of schema. Our research indicates that the proposed formalisms retain much of the expressiveness of DTDs without an increase in computational complexity.

研究の動機と目的

  • 順序に敏感な正規表現による過剰近似が生じるため、DTDが順序なしXMLコンテンツをモデル化する際に抱える制限を解消すること。
  • 兄弟要素の順序が重要でないデータ指向XMLアプリケーションにおいて、直感的で人間が読みやすく、意味論的に正確なスキーマ形式を設計すること。
  • 新形式主義下での基本的静的解析問題(例:スキーマの包含関係、クエリの充足可能性)の計算複雑性を特徴づけること。
  • DMSおよびMSが、データ指向の文脈で実際に使われる実際のDTDを十分に表現できるだけの表現力を保持しているかどうかを評価すること。
  • DMSおよびMSが、表現力と効率のバランスを取った順序なしXMLの実用的代替手段としての可能性を検討すること。

提案手法

  • 多重性(*, +, ?, 1)と順序なし連結(||)を用い、代替の制限付き排中(|)を用いることで、順序なしコンテンツモデルを定義する排他的多重性スキーマ(DMS)を提案する。
  • 排中を含まないDMSの制限形として、解析を単純化しつつも主要な表現力を保持する排中なし多重性スキーマ(MS)を導入する。
  • スキーマの普遍的依存グラフ(UDG)を定義し、構造的制約を捉え、ツイッグクエリの埋め込みチェックを効率的に行えるようにする。
  • UDGの展開を用いて、スキーマの最小木言語を特徴づけ、可換閉包下ですべての有効なドキュメントが正しく捉えられるようにする。
  • ポンピング補題を用いて、順序なしコンテンツに対する正規表現は、指数的サイズにまで膨張しうることを示し、よりコンパクトな形式主義の必要性を裏付ける。
  • グラフ埋め込み技術を活用して、スキーマおよびクエリの包含関係問題を部分グラフ同型問題に還元し、複雑性解析を可能にする。

実験結果

リサーチクエスチョン

  • RQ1DMSおよびMS形式主義は、正規表現による過剰な許容性を避ける一方で、DTDと同等の順序なしXMLドキュメント集合をモデル化できるか?
  • RQ2DMSおよびMS下でのコア静的解析タスク(例:スキーマ属性、包含関係、クエリ含意)の計算複雑性はいかほどか?
  • RQ3排中を含まないスキーマ(MS)への制限が、現実のデータ指向XMLアプリケーションにおいて十分な表現力を維持できるか?
  • RQ4XMarkおよびアムステルダム大学XMLウェブコレクションといった実世界のXMLベンチマークに対して、DMSおよびMSはDTDと比べてどの程度の表現力を有するか?
  • RQ5提案された形式主義は、特にツイッグクエリに対して、順序なしXMLにおける効率的なクエリ最適化および検証を可能にするか?

主な発見

  • XMarkベンチマークの77の正規表現のうち76がMSルールでカバーされ、77のうち76がDMSルールでカバーされ、強力な表現力カバレッジを示している。
  • アムステルダム大学XMLウェブコレクションのユニークな正規表現の84%がDMSでカバーされ、74.6%がMSでカバーされ、実用的関連性が裏付けられている。
  • アムステルダム大学コレクションの全DTDの55.5%がDMSでカバーされ、45.8%がMSでカバーされ、実世界のデータ指向スキーマへの広範な適用可能性が示された。
  • MS下でのスキーマ含意(IMPL)およびツイッグクエリはPTIMEに属するが、スキーマ包含関係(CNT)はcoNP完全であるため、コア解析が実行可能である。
  • 排中なしDTDの普遍的依存グラフの展開は、言語内での最小木を生成し、正しいかつ効率的なクエリ包含関係チェックを可能にする。
  • DMSにおける制限付き正規表現の可換閉包の使用により、単純な過剰許容DTDで見られる指数的膨張を回避しつつ、意味論的正確性を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。