Skip to main content
QUICK REVIEW

[論文レビュー] Empowering Investigative Journalism with Graph-based Heterogeneous Data Management

Angelos‐Christos G. Anadiotis, Oana Balalau|arXiv (Cornell University)|Feb 8, 2021
Web Data Mining and Analysis参考文献 28被引用数 9
ひとこと要約

本稿では、情報抽出を用いて異種でスキーマのないデータ(例:PDF、XML、リレーショナルデータベース)を統一された知識グラフに統合するグラフベースのシステム、ConnectionLensを提示する。本稿では、並列主記憶装置内キーワード検索エンジンP-GAMを導入し、従来のシステムと比較して数個のオーダーの高速化を達成した。これにより、出典追跡と低ユーザ作業量を伴い、バイオメディカル分野の利益相反ネットワークのインタラクティブな探索が可能になった。

ABSTRACT

Investigative Journalism (IJ, in short) is staple of modern, democratic societies. IJ often necessitates working with large, dynamic sets of heterogeneous, schema-less data sources, which can be structured, semi-structured, or textual, limiting the applicability of classical data integration approaches. In prior work, we have developed ConnectionLens, a system capable of integrating such sources into a single heterogeneous graph, leveraging Information Extraction (IE) techniques; users can then query the graph by means of keywords, and explore query results and their neighborhood using an interactive GUI. Our keyword search problem is complicated by the graph heterogeneity, and by the lack of a result score function that would allow to prune some of the search space. In this work, we describe an actual IJ application studying conflicts of interest in the biomedical domain, and we show how ConnectionLens supports it. Then, we present novel techniques addressing the scalability challenges raised by this application: one allows to reduce the significant IE costs while building the graph, while the other is a novel, parallel, in-memory keyword search engine, which achieves orders of magnitude speed-up over our previous engine. Our experimental study on the real-world IJ application data confirms the benefits of our contributions.

研究の動機と目的

  • 調査報道は、構造的・準構造的・非構造的なデータソースを多く扱うことが多く、古典的なデータ統合手法では効果を発揮しない。
  • ジャーナリストは、スキーマの欠如、ユーザの熟練度の低さ、出典追跡の必要性といった要因により、こうしたデータのキュレートとクエリ処理に困難を抱える。
  • 低認知度のエンティティや複雑なマルチソース接続を含む現実世界の条件では、既存のシステムは効率的なスケーリングに失敗する。
  • 目的は、バイオメディカル分野の調査報道に特化した、スケーラブルでインタラクティブかつ出典追跡可能なデータ管理パイプラインを構築することである。
  • 具体的には、並列主記憶装置処理を用いて、異種グラフ上の情報抽出コストを低減し、キーワード検索の高速化を図ることを目的とする。

提案手法

  • 本システムは、PDF、XML、リレーショナルデータベース、スプレッドシートなど多様なデータソースから、自動情報抽出技術を用いて一元的な異種グラフにデータを統合する。
  • 抽出ポリシーを適用することで、データソースを的確に処理し、情報抽出のオーバーヘッドを低減するとともに、重要な接続関係と出典追跡を維持する。
  • 中央集権的なグラフとしてのメディエーター(GAM)アルゴリズムにより、統一グラフ上のキーワード検索が可能となり、双方向エッジ走査と柔軟なスコアリングが可能である。
  • P-GAMはGAMの並列化されたバージョンであり、共有メモリ並列処理を活用して複数のCPUコアを介して検索を高速化し、一般用途ハードウェアでもパフォーマンスが向上する。
  • GUIを用いてクエリ結果およびその周辺のインタラクティブな探索が可能であり、ジャーナリストが複数のデータセットを横断して隠れた接続関係を発見できる。
  • 出典追跡はエンドツーエンドで保持され、ジャーナリストが各エンティティや関係性を元のソースまでたどれるようにする。

実験結果

リサーチクエスチョン

  • RQ1複数のソースからの異種でスキーマのないデータを、調査報道に適した統一グラフに効率的に統合する方法は何か?
  • RQ2グラフ構築時の情報抽出の計算コストを低減する技術は何か?ただし、重要な接続関係を損なわないようにする。
  • RQ3動的で異種のグラフ上でのキーワード検索を、現実世界の調査報道アプリケーションでインタラクティブな応答時間を達成できるように高速化するにはどうすればよいか?
  • RQ4並列で主記憶装置内に配置された検索エンジンは、異なるグラフサイズやデータモデルにおいて、クエリの正確性と出典追跡を維持したまま、どの程度スケーリング可能か?
  • RQ5本システムは、複数のデータセットにまたがる重要な利益相反関係を明らかにする可能性がある低認知度エンティティの発見をサポートできるか?

主な発見

  • P-GAMは、従来のシングルスレッドGAMエンジンと比較して、数個のオーダーの高速化を達成し、現実世界のバイオメディカル分野の利益相反データに対してインタラクティブな応答時間を実現した。
  • 抽出ポリシーの導入により、現実世界のデータセットで情報抽出コストを最大60%まで削減したが、重要な利益相反関係の検出には影響を及ぼさなかった。
  • 本システムは、6つ以上の異なるデータソースにまたがるクエリ結果を正常に取得し、異種環境下でのマルチデータセットキーワード検索の有効性を実証した。
  • キーワードの複雑さが増しても、システムはターゲットのインタラクティブ時間制限内に応答を維持した。これにより、スケーラビリティが確認された。
  • すべての結果に対して完全な出典追跡が保持され、ジャーナリストが出典を検証・引用できるようになり、ジャーナリズムの誠実性にとって不可欠な要因となった。
  • 異種データソースを一つのグラフに統合することで、例えば、あまり知られていない団体がバイオメディカル専門家を資金提供していたという、以前は見えなかった接続関係が発見された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。