[論文レビュー] Enriching Linked Datasets with New Object Properties
DART は、ウェブテキストパターンにおける文脈的類似性および並び替え検出を活用して、2つの指定された LOD クラス間で新しいオブジェクトプロパティを発見する非教師ありフレームワークである。DART は、既存のシステム(例:newOntExt)と比較して、発見された関係の正しさと数の両面で優れている。また、結果を自動的に接地することで、関係のない関係を排除し、T-Box の拡張のための候補プロパティ公理を生成する。
Although several RDF knowledge bases are available through the LOD initiative, the ontology schema of such linked datasets is not very rich. In particular, they lack object properties. The problem of finding new object properties (and their instances) between any two given classes has not been investigated in detail in the context of Linked Data. In this paper, we present DART (Detecting Arbitrary Relations for enriching T-Boxes of Linked Data) - an unsupervised solution to enrich the LOD cloud with new object properties between two given classes. DART exploits contextual similarity to identify text patterns from the web corpus that can potentially represent relations between individuals. These text patterns are then clustered by means of paraphrase detection to capture the object properties between the two given LOD classes. DART also performs fully automated mapping of the discovered relations to the properties in the linked dataset. This serves many purposes such as identification of completely new relations, elimination of irrelevant relations, and generation of prospective property axioms. We have empirically evaluated our approach on several pairs of classes and found that the system can indeed be used for enriching the linked datasets with new object properties and their instances. We compared DART with newOntExt system which is an offshoot of the NELL (Never-Ending Language Learning) effort. Our experiments reveal that DART gives better results than newOntExt with respect to both the correctness, as well as the number of relations.
研究の動機と目的
- LOD データセットにおけるオブジェクトプロパティの不足が、意味的表現力と推論能力を制限するという問題に対処すること。
- 2つの指定された LOD クラス間で、新しい意味のあるオブジェクトプロパティを発見する非教師あり手法を開発すること。
- 発見された関係を既存の LOD プロパティに自動的に接地し、関係のないか、意味的に不一致する関係を除外すること。
- T-Box の拡張のための候補プロパティ公理(例:部分プロパティ、同等、逆プロパティ)を生成すること。
- 既存のシステム(例:newOntExt)と比較して、発見された関係の正確性と再現率の両面で優れること。
提案手法
- DART は、2つの指定された LOD クラスの個体を結ぶウェブコーパスからのテキストパターンを抽出する。
- 文脈的類似性と並び替え検出を適用して、意味的に類似したパターンをクラスタリングし、潜在的なオブジェクトプロパティとする。
- 既存の LOD プロパティとのドメインおよびレンジの型の整合性をチェックすることで、自動的な接地を実行する。
- 接地された関係は意味的関連性について検証され、不適切な関係(例:「宗教」と「国」の間で「父親である」)は除外される。
- フレームワークは、部分プロパティ、同等、逆プロパティ関係を含む、候補プロパティ公理を生成する。
- 手動によるアノテーションや外部知識を一切必要とせず、完全に自動化された発見とマッピングをサポートする。
実験結果
リサーチクエスチョン
- RQ1非教師あり手法は、2つの指定された LOD クラス間で、新しいオブジェクトプロパティを効果的に発見できるか?
- RQ2文脈的類似性と並び替え検出をどのように組み合わせることで、関係クラスタリングの正確性を向上させられるか?
- RQ3自動接地によって、意味的に誤りまたは不一致する関係をどの程度効果的に排除できるか?
- RQ4DART は、newOntExt などの既存システムと比較して、発見された関係の正確性と数の両面で優れているか?
- RQ5DART は、T-Box の拡張のための有効な候補プロパティ公理(例:部分プロパティ、逆プロパティ)を生成できるか?
主な発見
- Rulers-Empires 組み合わせにおいて、DART は 0.833 の正確性を達成し、正確性と関係数の両面で newOntExt を顕著に上回った。
- Religions-Countries 組み合わせでは、DART が 25 個の正しい関係を特定し、50% の正確性を示した。これは、多様なクラスペアにわたる堅牢性を示している。
- 接地フェーズにより、「宗教」と「国」の間で「父親である」といった意味的に不一致する関係が除外され、性能向上が達成された。
- Writers-Novels 間では、DART が 15 個の意味のある関係を発見し、52% の正確性を示した。これは、ドメイン特化型の関係抽出において有効であることを示している。
- Music genres-Music genres 組み合わせでは、DART は 69% の正確性を達成し、9 個の接地済み関係を生成した。これには、「は~のサブジェンルである」が既存プロパティにマッピングされた。
- DART は、関係の数と正確性の両面で newOntExt を上回り、特に「演奏しない」(doesn’t play at)と「演奏したい」(wants to play at)といった意味的に異なる関係を区別する能力に優れていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。