Skip to main content
QUICK REVIEW

[論文レビュー] Event Search and Analytics: Detecting Events in Semantically Annotated Corpora for Search and Analytics

Dhruv Gupta|Max Planck Digital Library|Mar 1, 2016
Semantic Web and Ontologies参考文献 23被引用数 4
ひとこと要約

本稿では、固有表現、地理的場所、時系列表現を用いて、意味的にアノテートされたテキストコーパスにおける出来事の検出と分析のためのフレームワークを提案する。Wikipedia や Freebase などのソースからの意味的アノテーションを活用することで、大規模なテキストコレクションにおける出来事ベースのナビゲーションを通じて、情報検索、意味的検索、出来事分析の向上が可能になる。

ABSTRACT

In this article, I present the questions that I seek to answer in my PhD research. I posit to analyze natural language text with the help of semantic annotations and mine important events for navigating large text corpora. Semantic annotations such as named entities, geographic locations, and temporal expressions can help us mine events from the given corpora. These events thus provide us with useful means to discover the locked knowledge in them. I pose three problems that can help unlock this knowledge vault in semantically annotated text corpora: i. identifying important events; ii. semantic search; and iii. event analytics.

研究の動機と目的

  • 意味的にアノテートされたコーパスにおいて、ユーザーの情報ニーズの代理として出来事を用いることで、従来の情報検索を改善すること。
  • 固有表現、場所、時刻表現を用いて出来事を抽出・整理することで、意味的検索および分析を可能にすること。
  • 大規模なテキストコレクションから時系列順に並べられた出来事を抽出することによって、計算的文化学およびデジタル・ヒューマニティーズを支援すること。
  • 重要な出来事の特定、検索結果の多様化、出来事駆動型コンテンツの要約のためのスケーラブルなアルゴリズムを開発すること。
  • Wikipedia や YAGO や Freebase のようなキュレート済みのソースを用いた客観的な評価ベンチマークの構築

提案手法

  • HeidelTime や SUTime などのツールを用いて抽出された固有表現、地理的場所、時系列表現といった意味的アノテーションを活用する。
  • 固有表現の曖昧除去および固有表現解決のため、外部知識ベース(例:Freebase、Wikipedia)へのマッピングを実施する。
  • 出来事の構造化された4要素組み合わせ(クエリ、固有表現、場所、時刻)として表現し、テキストからのキーワードを付加して強化する。
  • 確率的モデルおよび類似度関数(例:KLダイバージェンス)を用いて、出来事間のテクスト的および時系列的類似度を計算する。
  • 時刻、場所、固有表現といった多次元的属性に基づくクラスタリングアルゴリズムを適用し、関連する出来事を検出およびグループ化する。
  • コーパスサイズに比例して線形にスケーラブルなインデクシング構造を採用することで、大規模な出来事分析を効率的に行う。

実験結果

リサーチクエスチョン

  • RQ1意味的アノテーションをどのように活用することで、大規模なテキストコーパスにおける重要な出来事の検出を可能にし、情報検索の向上を図れるか?
  • RQ2出来事検出および類似度計算のための、固有表現、地理的場所、時系列表現を最も適切に表現する数学的モデルは何か?
  • RQ3検索結果の多様性と新規性を支援するように、出来事ベースの検索および分析をどのように設計できるか?
  • RQ4出来事検出および要約のパフォーマンスを評価するにあたり、最も信頼性が高い評価指標およびグランド・トゥース・ソースは何か?
  • RQ5意味的にアノテートされた大規模コーパスにおいて、正確性を維持しつつ、出来事検出システムをどのように効率的にスケーリングできるか?

主な発見

  • 固有表現、地理座標、正規化された時刻区間といった意味的アノテーションにより、非構造化テキストからの構造的出来事の自動検出が可能になる。
  • 時系列的、空間的、固有表現ベースの多次元的類似度を用いた出来事検出により、関連するストーリーおよび新規トピックの同定が向上する。
  • Wikipedia のカテゴリーページやキュレート済みのタイムラインを用いた評価により、出来事検出および要約アルゴリズムのテストに信頼性のあるグランド・トゥースが得られる。
  • 正確性、再現率、F1、α-nDCG といった指標は、出来事検出および結果の多様化アルゴリズムのパフォーマンスを効果的に測定できる。
  • Freebase や YAGO のような知識ベースの統合により、固有表現の曖昧除去が強化され、スケーラブルで正確な出来事表現が可能になる。
  • 提案されたフレームワークにより、デジタルテキストコーパスから時系列順に並べられた出来事としての世界史を抽出・整理し、計算的文化学を実現できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。