Skip to main content
QUICK REVIEW

[論文レビュー] Semi-Supervised Web Wrapper Repair via Recursive Tree Matching.

Joseph Cohen, Wei Ding|arXiv (Cornell University)|May 6, 2015
Web Data Mining and Analysis参考文献 15被引用数 7
ひとこと要約

XTPathは、再帰的ツリーマッチングを用いて、進化するWebページ間で構造的・文脈的に類似したDOMノードを特定する半教師ありラッパー修復手法であり、アノテート済みの訓練データを活用して抽出の頑健性を向上させる。75の多様なWebサイトからなる117,422ページのデータセットにおいて、XPathおよび商用システムを上回る性能を発揮した。

ABSTRACT

Continuous data extraction pipelines using wrappers have become common and integral parts of businesses dealing with stock, flight, or product information. Extracting data from websites that use HTML templates is difficult because available wrapper methods are not designed to deal with websites that change over time (the inclusion or removal of HTML elements). We are the first to perform large scale empirical analyses of the causes of shift and propose the concept of domain entropy to quantify it. We draw from this analysis to propose a new semi-supervised search approach called XTPath. XTPath combines the existing XPath with carefully designed annotation extraction and informed search strategies. XTPath is the first method to store contextual node information from the training DOM and utilize it in a supervised manner. We utilize this data with our proposed recursive tree matching method which locates nodes most similar in context. The search is based on a heuristic function that takes into account the similarity of a tree compared to the structure that was present in the training data. We systematically evaluate XTPath using 117,422 pages from 75 diverse websites in 8 vertical markets that covers vastly different topics. Our XTPath method consistently outperforms XPath and a current commercial system in terms of successful extractions in a blackbox test. We are the first supervised wrapper extraction method to make our code and datasets available (online here: this http URL).

研究の動機と目的

  • Webサイト間でのHTMLテンプレートの動的変更に起因するラッパー障害の課題に対処すること。
  • ドメインエントロピーという新規指標を用いて、テンプレート不安定性の原因を定量化すること。
  • 訓練済みDOMからの文脈的ノード情報を利用した半教師あり手法を開発し、進化するWeb構造における検索を支援すること。
  • 各サイトの変更に対して完全な再トレーニングや手動再設定を必要とせず、堅牢かつスケーラブルなラッパー修復を可能にすること。

提案手法

  • XTPathはXPathと再帰的ツリーマッチングアルゴリズムを統合し、ノードの内容、属性、位置的文脈に基づいてサブツリー構造を比較する。
  • 訓練DOM構造との類似度をスコア化するヒューリスティック関数を導入し、文脈的整合性が高いノードを優先順位付けする。
  • 訓練DOMからのアノテート済みの文脈的ノード情報を保存・再利用することで、構造的シフトへの監視付き適応を可能にする。
  • 構造的類似度とパスの有効性の両方をバランスさせるコスト関数を用いて、候補となるXPath式に対するインformedな探索を実行する。
  • ドメインエントロピーを計算し、Webサイト全体におけるテンプレート不安定性の度合いを定量化することで、頑健な探索ヒューリスティックの設計を支援する。
  • 本手法は、8つの垂直市場にまたがる75のWebサイトからなる117,422ページの大型データセットを用いてトレーニングおよび評価された。

実験結果

リサーチクエスチョン

  • RQ1ラッパー障害を引き起こすWebテンプレートの構造的シフトの主な原因は何か?
  • RQ2ドメインエントロピーを用いることで、多様なWebドメインにおけるテンプレート不安定性を定量化・予測できるか?
  • RQ3文脈的ノード情報と併用した再帰的ツリーマッチングは、標準XPathと比較してラッパー修復の正確性を向上させられるか?
  • RQ4実世界のブラックボックス評価において、XTPathは既存の商用およびオープンソースラッパー・システムをどの程度上回るか?

主な発見

  • ドメインエントロピーは、多様なWebサイトにおけるテンプレート不安定性を効果的に定量化でき、構造的シフトがWebの垂直市場全体にわたり頻発的かつ体系的であることを示した。
  • 評価対象の75のWebサイトすべてにおいて、XTPathは標準XPathよりも成功したデータ抽出を達成した。
  • 同じデータセットを用いたブラックボックステストにおいて、XTPathは現在の商用ラッパー・システムを上回る抽出成功率を達成した。
  • フライトや製品リストなど変動性の高いドメインを含む、全8つの垂直市場において一貫した性能向上を示した。
  • 再帰的ツリーマッチングによる文脈的ノード情報の統合により、テンプレート変更下でもより正確で安定したノード選択が可能になった。
  • XTPathは、再現可能性およびベンチマーク評価を可能にするために、コードと訓練データセットの両方を公開した最初の監視付きラッパー抽出手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。