Skip to main content
QUICK REVIEW

[論文レビュー] Dating Texts without Explicit Temporal Cues

Abhimanu Kumar, Jason Baldridge|arXiv (Cornell University)|Nov 10, 2012
Topic Modeling参考文献 26被引用数 12
ひとこと要約

本稿では、明示的な時系列表現に依存せずに、暗黙の時系列的手がかりのみを用いて文書の日付を特定する言語モデルベースの手法を提案する。Wikipediaの伝記データを用いて訓練し、時系列的単位(chronon)に基づく言語モデルとJelinek-Mercer平滑化を用いた情報検索技術を適用することで、伝記では中央値誤差22年、小説では17年という結果を達成し、数千年にわたる多様なジャンルにわたり強固なクロスジャンル時系列日付特定が可能であることを示している。

ABSTRACT

This paper tackles temporal resolution of documents, such as determining when a document is about or when it was written, based only on its text. We apply techniques from information retrieval that predict dates via language models over a discretized timeline. Unlike most previous works, we rely {\it solely} on temporal cues implicit in the text. We consider both document-likelihood and divergence based techniques and several smoothing methods for both of them. Our best model predicts the mid-point of individuals' lives with a median of 22 and mean error of 36 years for Wikipedia biographies from 3800 B.C. to the present day. We also show that this approach works well when training on such biographies and predicting dates both for non-biographical Wikipedia pages about specific years (500 B.C. to 2010 A.D.) and for publication dates of short stories (1798 to 2008). Together, our work shows that, even in absence of temporal extraction resources, it is possible to achieve remarkable temporal locality across a diverse set of texts.

研究の動機と目的

  • 文書の日付を、明示的な時系列表現に依存せずに、テキスト内の暗黙の時系列的手がかりのみに基づいて特定する手法を開発すること。
  • Wikipediaの伝記データで訓練された言語モデルが、非伝記的ページや文学的作品を含む多様なテキストタイプの日付特定にどの程度耐性を持って応用可能かを評価すること。
  • 平滑化手法(例:Jelinek-Mercer、ディリクレ)と類似度測定法(尤度 vs. KLダイバージェンス)の違いが、時系列ドキュメントランク付けに与える効果を調査すること。
  • 明示的な日付を含まない文書においても、語彙の使用に時系列情報が埋め込まれており、言語間およびジャンル間への応用が可能であることを示すこと。

提案手法

  • 時間軸を、語の分布がモデル化される連続的な原子的時間区間(chronon)に離散化する。
  • 紀元前3800年から2010年までのWikipedia伝記データを用いて、各chrononごとにunigram言語モデルを訓練する。
  • 一般文書コレクションモデルとのJelinek-Mercer補間を用いて、各chrononモデルを平滑化することで一般化性能を向上させる。
  • テストドキュメントに対しては、unigramモデルを構築し、各chrononモデルとの間で文書尤度またはKLダイバージェンスを比較して、最も確率の高い時系列期間を同定する。
  • 明示的な日付を除外するために、時系列表現識別器(例:HeidelTime)を用い、訓練およびテストデータから明示的時系列表現を除去することで、暗黙の手がかりに依存するようにする。
  • 評価は3つのタスク(伝記の日付特定、出来事ページの日付特定、小説の日付特定)を対象とし、中央値誤差および平均絶対誤差を指標とする。

実験結果

リサーチクエスチョン

  • RQ1Wikipediaの伝記データで訓練された言語モデルは、明示的な時系列的表現に依存せず、暗黙の時系列的手がかりのみに基づいて文書の時系列期間を正確に予測できるか?
  • RQ2異なる平滑化手法(例:Jelinek-Mercer、ディリクレ)が、chrononに基づくドキュメント日付特定の性能にどのように影響を与えるか?
  • RQ3明示的な時系列的表現が存在しない状況で、文書尤度アプローチとKLダイバージェンスアプローチのどちらがより優れた時系列局所化を達成するか?
  • RQ4伝記データで訓練されたモデルが、歴史的出来事ページや小説などの非伝記的テキストへどの程度一般化可能か?

主な発見

  • 最良のモデルは、Wikipedia伝記を用いて個人の人生の中央値を予測する際、中央値誤差22年、平均誤差36年を達成した。
  • 特定の年を扱う非伝記的Wikipediaページ(紀元前500年から2010年)に対しては、中央値誤差21年、平均誤差36年を達成した。
  • Gutenbergプロジェクトの小説(1798年~2008年)に適用した場合、中央値誤差17年、平均誤差20年を達成し、小説分野への一般化性能が顕著に優れていることが示された。
  • Jelinek-Mercer平滑化は他の平滑化手法を上回り、collectionモデルとの線形補間がchronon言語モデルに最も効果的であることを示している。
  • 文書尤度ベースとKLダイバージェンスベースの両方のランク付け手法は類似した性能を示しており、どちらのアプローチも時系列ドキュメントランク付けに効果的に使用可能である。
  • 最も予測に寄与する語は、しばしば希少な固有名詞(例:capote, komatsu)や特定の時代に結びついた語(例:teleplay, wavelength)であり、共通語である「goodness」や「tub」は予測に最も寄与しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。