[論文レビュー] Document Spanners for Extracting Incomplete Information: Expressiveness and Complexity
本稿では、不完全またはオプションの情報を扱うために文書スパンナを拡張し、正規表現式と抽出ルールに宣言的意味論を導入した。2つの形式的体系の表現力が等価であることを確立し、包含関係と充足可能性がともにPSPACE完全であることを証明し、特定の条件下ではクエリの列挙が tractable であることを示した。
Rule-based information extraction has lately received a fair amount of attention from the database community, with several languages appearing in the last few years. Although information extraction systems are intended to deal with semistructured data, all language proposals introduced so far are designed to output relations, thus making them incapable of handling incomplete information. To remedy the situation, we propose to extend information extraction languages with the ability to use mappings, thus allowing us to work with documents which have missing or optional parts. Using this approach, we simplify the semantics of regex formulas and extraction rules, two previously defined methods for extracting information, extend them with the ability to handle incomplete data, and study how they compare in terms of expressive power. We also study computational properties of these languages, focusing on the query enumeration problem, as well as satisfiability and containment.
研究の動機と目的
- すべての変数に値が割り当てられることを要求する従来のルールベース情報抽出システムの制限を解消し、欠落またはオプションのフィールドを含む文書に不適切である問題に対処する。
- 正規表現ベースおよびDatalogに類似した抽出ルールに宣言的意味論を導入し、その解釈を簡素化・統一する。
- マッピングを許容することで、部分的または不完全な情報の抽出を可能にし、オプションまたは欠落したデータコンponentを表現する。
- 新しい形式的体系における表現力、充足可能性、包含関係の問題を研究し、理論的基盤をよりよく理解する。
- クエリ列挙の計算複雑性を分析し、出力が指数的になる可能性がある情報抽出システムにおける主要タスクを扱う。
提案手法
- 従来のドキュメントスパンナを拡張し、変数からスパンへの部分関数(マッピング)を導入して、オプションまたは欠落したデータを表現する。
- 2つの形式的体系を定義する:マッピングを含む正規表現式と、マッピングを含むDatalogに類似した抽出ルールで、両者に宣言的意味論を適用する。
- 点集合に交差しないマッピングと一意の実行を保証するため、変数オートマトン(VA)を用いてスパンナクエリの挙動をモデル化する。
- 各形式的体系に対して同等のオートマトンを構築することで、2つの形式的体系が表現力的に等価であることを証明する。
- 充足可能性および包含関係の問題を、変数オートマトン上のモデルチェックイング問題に還元し、PSPACE完全性を示す。
- スパンナが点集合に交差しないマッピングを備えた決定的逐次的VAとして表現される場合、クエリ列挙が tractable(多項式遅延)であることを示す。
実験結果
リサーチクエスチョン
- RQ1ルールベース情報抽出言語を、意味の明確さを損なわずに不完全またはオプションのデータを扱えるように拡張できるか?
- RQ2マッピングを用いて不完全なデータを扱うように拡張された正規表現ベースおよびDatalogに類似したスパンナ形式的体系の表現力は何か?
- RQ3新しい形式的体系における充足可能性および包含関係の問題はどのように振る舞い、その計算複雑性は何か?
- RQ4新しいスパンナ形式的体系におけるクエリ列挙は tractable か?どのような条件下でそうなるか?
- RQ5正規表現式および抽出ルールの意味論を、解析木やオートマトン構築に基づく手続き的解釈ではなく、完全に宣言的に行えるか?
主な発見
- マッピングを備えた提案された形式的体系により、欠落またはオプションのフィールドを含む文書から部分的または不完全な情報を抽出でき、従来のシステムの主な制限を克服した。
- マッピングを含む正規表現式と、マッピングを含むDatalogに類似したルールは、表現力的に等価であり、両者とも同じクラスのスパンナクエリを表現可能である。
- 新しい形式的体系における充足可能性および包含関係の問題はPSPACE完全であり、高いが決定可能である複雑性を示している。
- 基礎となるオートマトンが決定的かつ逐次的で、点集合に交差しないマッピングを持つ場合、新しいスパンナ形式的体系におけるクエリ列挙は tractable(多項式遅延)である。
- 決定的逐次的変数オートマトンの使用により、ドキュメント-マッピングペアごとに一意の実行が保証され、正しいかつ効率的な意思決定手順が可能になった。
- 形式的体系は手続き的解釈(解析木やオートマトン構築に基づく)を避ける宣言的意味論をサポートしており、明確性と正しさが向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。