Skip to main content
QUICK REVIEW

[論文レビュー] Web Data Knowledge Extraction

Juan M. Tirado, Ovidiu Şerban|arXiv (Cornell University)|Mar 24, 2016
Web Data Mining and Analysis参考文献 21被引用数 4
ひとこと要約

本論文は、ドメインエキスパートが最小限の技術的背景で再利用可能で設定可能なコンポーネントを通じてデータ抽出パイプラインを主導できる、エキスパート中心で機械支援を行うウェブ知識抽出手法を提示する。自動構造分析とエキスパート主導のアノテーションを統合することで、開発者依存を低減し、欧州の多様な公開調達データソースから統一スキーマに抽出することに成功し、スケーラビリティと保守性を示した。

ABSTRACT

A constantly growing amount of information is available through the web. Unfortunately, extracting useful content from this massive amount of data still remains an open issue. The lack of standard data models and structures forces developers to create adhoc solutions from the scratch. The figure of the expert is still needed in many situations where developers do not have the correct background knowledge. This forces developers to spend time acquiring the needed background from the expert. In other directions, there are promising solutions employing machine learning techniques. However, increasing accuracy requires an increase in system complexity that cannot be endured in many projects. In this work, we approach the web knowledge extraction problem using an expertcentric methodology. This methodology defines a set of configurable, extendible and independent components that permit the reutilisation of large pieces of code among projects. Our methodology differs from similar solutions in its expert-driven design. This design, makes it possible for subject-matter expert to drive the knowledge extraction for a given set of documents. Additionally, we propose the utilization of machine assisted solutions that guide the expert during this process. To demonstrate the capabilities of our methodology, we present a real use case scenario in which public procurement data is extracted from the web-based repositories of several public institutions across Europe. We provide insightful details about the challenges we had to deal with in this use case and additional discussions about how to apply our methodology.

研究の動機と目的

  • ドメインエキスパートをデータ抽出プロセスの中心に置くことで、ウェブ知識抽出における開発者依存を低減すること。
  • API や標準フォーマットが存在しない状況下でも、非構造的・多様で非標準的なウェブソースから構造化データを抽出する課題に対処すること。
  • 複数のデータソースとターゲットデータベースをサポートする、再利用可能でモジュラーかつ拡張可能なパイプラインアーキテクチャを設計すること。
  • 一時的・一括処理に特化した実装と比較して、保守性の向上と開発時間の短縮を図ること。
  • 公開調達データにおける多言語コンテンツ、一貫性のないデータ品質、ドメイン固有の用語といった現実世界の複雑さを扱えること。

提案手法

  • ドメインエキスパートが設定可能なパイプラインシステムを用いてデータ抽出ルールを定義するエキスパート中心の運用サイクルを採用する。
  • 機械支援構造分析コンponentを用いてHTMLを解析し、XMLに変換し、エキスパートのアノテーションを支援するために推奨されるXPath式を提示する。
  • データ構造を辞書ベースで表現するアプローチを採用し、平坦な構造と階層的なマッピングの両方をサポートすることで、柔軟なデータモデリングを実現する。
  • MITFORDフレームワークを用いてXMLからリレーショナルデータベースへのマッピングを宣言的構成形式で実現し、データ変換をコードから分離する。
  • パラレル処理と依存関係管理を実装することで、パフォーマンスと信頼性を向上させる。
  • 自動チェックとサンプルドキュメントテストを用いて、XMLおよびHTMLマッピングレベルでの検証を実施する。

実験結果

リサーチクエスチョン

  • RQ1プログラミングスキルが不要な状況下で、ドメインエキスパートがどのようにウェブデータ抽出を主導できるか。
  • RQ2機械支援構造分析は、ウェブ抽出におけるデータフィールドの特定とアノテーションに要する手作業の負荷をどの程度低減できるか。
  • RQ3再利用可能でモジュラーなパイプラインアーキテクチャは、一時的・一括処理の実装と比較して、開発時間の短縮と保守性の向上に顕著な効果をもたらすか。
  • RQ4本手法は、多様で非標準的かつ多言語対応の公開調達ソースからのデータ抽出において、どの程度効果的か。
  • RQ5メタデータ、API、または標準フォーマットが存在しない状況下で、現実世界のウェブデータ抽出における主な課題は何か。

主な発見

  • エキスパート中心の手法により、技術的背景が乏しいドメインエキスパートが、最小限の開発者参加で完全なデータ抽出パイプラインを設定・管理できるようになった。
  • 機械支援構造分析の活用により、複雑なHTMLドキュメントにおけるデータフィールドの特定とアノテーションに要する時間と作業負荷が著しく削減された。
  • モジュラーかつ再利用可能なコンポーネントの採用により、複数のデータソースにわたる開発時間の短縮とコードの保守性の向上が達成された。
  • 本システムは、フォーマットやデータ品質のばらつきが著しい14のヨーロッパ諸国からの多様なデータソースから、公開調達データを正常に抽出・正規化した。
  • 抽出されたデータベースは、1ソースあたり10,000~100,000件のエントリを格納しており、平均エントリサイズは10~50 KBであった。これはスケーラビリティを示している。
  • 検証の結果、抽出データの95%が事前に定義された構造的・意味的整合性基準を満たしており、パイプラインの信頼性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。