Skip to main content
QUICK REVIEW

[论文解读] Dating Texts without Explicit Temporal Cues

Abhimanu Kumar, Jason Baldridge|arXiv (Cornell University)|Nov 10, 2012
Topic Modeling参考文献 26被引用 12
一句话总结

本文提出一种基于语言模型的方法,仅利用隐式时间线索对文本进行年代判定,无需依赖显式时间表达。通过在维基百科人物传记上进行训练,并结合基于 chronon 的语言模型与 Jelinek-Mercer 平滑技术进行信息检索,该方法在人物传记中实现 22 年的中位数误差,在短篇小说中实现 17 年的中位数误差,展示了跨越数千年、跨文本类型的鲁棒时间定位能力。

ABSTRACT

This paper tackles temporal resolution of documents, such as determining when a document is about or when it was written, based only on its text. We apply techniques from information retrieval that predict dates via language models over a discretized timeline. Unlike most previous works, we rely {\it solely} on temporal cues implicit in the text. We consider both document-likelihood and divergence based techniques and several smoothing methods for both of them. Our best model predicts the mid-point of individuals' lives with a median of 22 and mean error of 36 years for Wikipedia biographies from 3800 B.C. to the present day. We also show that this approach works well when training on such biographies and predicting dates both for non-biographical Wikipedia pages about specific years (500 B.C. to 2010 A.D.) and for publication dates of short stories (1798 to 2008). Together, our work shows that, even in absence of temporal extraction resources, it is possible to achieve remarkable temporal locality across a diverse set of texts.

研究动机与目标

  • 开发一种仅基于文本中隐式时间线索、不依赖显式时间表达的文档年代判定方法。
  • 评估在维基百科人物传记上训练的语言模型在多样化文本类型(包括非传记类页面和文学作品)上的年代判定鲁棒性。
  • 探索不同平滑技术与相似性度量方法(似然度 vs. KL 散度)在时间文档排序中的有效性。
  • 证明即使在缺乏显式日期的文本中,词汇使用也蕴含时间信息,从而支持跨语言与跨文本类型的适用性。

提出的方法

  • 该方法将时间轴离散化为 chronon——连续的原子时间区间,在每个区间上建模词频分布。
  • 使用从公元前 3800 年至公元 2010 年的维基百科人物传记训练每个 chronon 的一元语言模型。
  • 通过 Jelinek-Mercer 插值法对每个 chronon 模型进行平滑处理,结合整体语料库模型以提升泛化能力。
  • 对于测试文档,构建一元语言模型,并通过文档似然度或 KL 散度与每个 chronon 模型进行比较,以识别最可能的时间段。
  • 使用时间表达识别工具(如 HeidelTime)从训练和测试数据中移除显式日期,以确保方法完全依赖隐式线索。
  • 在三个任务上评估该方法:人物传记年代判定、事件页面年代判定与短篇小说年代判定,采用中位数绝对误差与均值绝对误差作为指标。

实验结果

研究问题

  • RQ1在仅依赖隐式时间线索的前提下,基于维基百科人物传记训练的语言模型能否准确预测文档的时间段?
  • RQ2不同平滑技术(如 Jelinek-Mercer、Dirichlet)如何影响基于 chronon 的文档年代判定性能?
  • RQ3在缺乏显式时间表达的情况下,文档似然度方法与 KL 散度方法中,哪一种能实现更优的时间定位?
  • RQ4基于人物传记训练的模型在多大程度上能泛化至非传记类文本,如历史事件页面与虚构短篇小说?

主要发现

  • 最佳模型在基于维基百科人物传记预测个体生命中点时,实现 22 年的中位数误差与 36 年的均值误差。
  • 在针对特定年份(公元前 500 年至公元 2010 年)的非传记类维基百科页面上,模型实现 21 年的中位数误差与 36 年的均值误差。
  • 当应用于古腾堡计划中的短篇小说(1798–2008 年)时,模型实现 17 年的中位数误差与 20 年的均值误差,表明其在小说文本中具有强大的泛化能力。
  • Jelinek-Mercer 平滑优于其他平滑方法,表明与语料库模型进行线性插值在 chronon 语言建模中最为有效。
  • 基于文档似然度与 KL 散度的排序方法表现相近,表明两者均可有效用于时间文档排序。
  • 最具预测力的词汇通常是罕见的专有名词(如 capote、komatsu)或与特定时代相关的术语(如 teleplay、wavelength),而像 'goodness' 或 'tub' 这类常见词则预测力最弱。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。