Skip to main content
QUICK REVIEW

[論文レビュー] Hedera: Scalable Indexing and Exploring Entities in Wikipedia Revision History

Tuan Tran, Tu Ngoc Nguyen|arXiv (Cornell University)|Jan 14, 2017
Wikis in Education and Collaboration参考文献 2被引用数 4
ひとこと要約

Hedera は、拡張性があり、Map-Reduce ベースのフレームワークであり、Wikipedia の完全な改訂履歴における意味的エンティティの効率的インデクシングと探索を可能にする。小さなクラスタ上で 100 万エンティティの 2.5 年分の改訂を数時間で処理でき、動的エンティティ進化分析のためのインクリメンタルで時刻に配慮したインデクシングをサポートし、ElasticSearch を通じたリアルタイム可視化を実現する。

ABSTRACT

Much of work in semantic web relying on Wikipedia as the main source of knowledge often work on static snapshots of the dataset. The full history of Wikipedia revisions, while contains much more useful information, is still difficult to access due to its exceptional volume. To enable further research on this collection, we developed a tool, named Hedera, that efficiently extracts semantic information from Wikipedia revision history datasets. Hedera exploits Map-Reduce paradigm to achieve rapid extraction, it is able to handle one entire Wikipedia articles revision history within a day in a medium-scale cluster, and supports flexible data structures for various kinds of semantic web study.

研究の動機と目的

  • DBpedia のような静的知識ベースが Wikipedia コンテンツ内の時間的ダイナミクスを欠いているという制限に対処すること。
  • 意味ウェブ研究のための、スケーラブルで柔軟かつインクリメンタルな Wikipedia 改訂履歴分析を可能にすること。
  • 中央集権的システムでは処理が困難な、Wikipedia 改訂データセット全体の処理における計算的課題を克服すること。
  • 時刻に配慮したインデクシングを通じて、エンティティ進化、共起関係、時間的関係の動的探索を可能にすること。
  • 研究者が Wikipedia における縦断的意味的変化をプロトタイプ化および分析できる、オープンソースで拡張可能なフレームワークを提供すること。

提案手法

  • Hedera は、Hadoop Map-Reduce パラダイムを用いて、Wikipedia XML 改訂ダンプの処理を分散・並列化する。
  • エンティティ単位(同じエンティティの改訂をグループ化)とドキュメント単位(リンク追跡を伴う任意の配分)の 2 つのパーティショニング戦略をサポートする。
  • 時間範囲、エンティティリスト、またはコンテンツタイプに基づいてフィルタリング可能なカスタマイズ可能なプロプロセッサを提供し、XML または JSON 形式の Hadoop ファイルスプリットを出力する。
  • 抽出オペレータ(例:エンティティ検出、アンカーテキスト抽出)をデータストリームにプッシュダウンすることで、ネットワークトラフィックを削減する変換レイヤーを備える。
  • 結果を、インクリメンタルな更新と時刻ベースのクエリをサポートする緩やかな構造化スキーマで ElasticSearch にインデクシングする。
  • 時間的インデクシングはアンカーテキストおよびフルテキストインデックスに基づき、1 日未満の粒度でエンティティダイナミクスの可視化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1スケール上で Wikipedia の完全な改訂履歴から意味的エンティティを効率的に抽出・インデクシングするにはどうすればよいか?
  • RQ2中央集権的アプローチと比較して、分散型 Map-Reduce 処理が縦断的 Wikipedia データに対して示す性能特性は何か?
  • RQ3時間的アンカーテキストおよびフルテキストインデクシングは、Wikipedia コンテンツ内の動的関係や出来事の兆候をどのように明らかにするか?
  • RQ4インクリメンタルインデクシングは、エンティティ進化および共起パターンのリアルタイム探索を可能にするか?
  • RQ5Hedera のような柔軟で拡張可能なフレームワークを用いることで、Wikipedia における時間的意味的分析にどのような実用的利点が得られるか?

主な発見

  • Hedera は、100 万エンティティの 2.5 年分の Wikipedia 改訂履歴(未圧縮テキストで合計 601 GB)を、8 ノードのクラスタ上で数時間で処理できる。
  • システムは中央集権的インデクシング手法を上回り、データ量が増加するにつれて性能差が指数関数的に拡大する。
  • 時間的アンカーテキストインデクシングは、'Euro 2012' や 'オリンピック競技大会' のような出来事駆動のエンティティ言及ピークを効果的に捉え、現実の出来事と整合する。
  • ウサイン・ボルトとモー・ファラのエンティティ間の共起分析では、2012 年の夏のオリンピック期間中に言及のピークが同期していることが確認され、時間的関係検出の有効性が裏付けられた。
  • 柔軟なフィルタリングとユーザー定義の抽出ロジックの使用により、部分的または時間フィルタリングされた改訂データ上で研究ワークロードの迅速なプロトタイピングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。