Skip to main content
QUICK REVIEW

[论文解读] Mining and discovering biographical information in Difangzhi with a language-model-based approach

Peter K. Bol, Chao-Lin Liu|arXiv (Cornell University)|Apr 8, 2015
Natural Language Processing Techniques参考文献 3被引用 3
一句话总结

本文提出一种基于语言模型的方法,从宋至清时期的地方志(difangzhi)中挖掘传记数据,实现对姓名、官职和亲属关系的系统性提取。通过将自然语言处理技术应用于历史文献,该方法揭示了此前隐含的社会与地理关联,显著扩展了中国传记数据库,且仅需极少的人工校对。

ABSTRACT

We present results of expanding the contents of the China Biographical Database by text mining historical local gazetteers, difangzhi. The goal of the database is to see how people are connected together, through kinship, social connections, and the places and offices in which they served. The gazetteers are the single most important collection of names and offices covering the Song through Qing periods. Although we begin with local officials we shall eventually include lists of local examination candidates, people from the locality who served in government, and notable local figures with biographies. The more data we collect the more connections emerge. The value of doing systematic text mining work is that we can identify relevant connections that are either directly informative or can become useful without deep historical research. Academia Sinica is developing a name database for officials in the central governments of the Ming and Qing dynasties.

研究动机与目标

  • 系统性地从宋至清时期的地方志文本中提取传记信息,如姓名、官职和亲属关系。
  • 通过自动化发现历史记录中的社会与地理关联,减少对人工档案研究的依赖。
  • 通过地方志中的结构化数据扩展中国传记数据库,提升对地方官员和知名地方人物的覆盖范围。
  • 证明基于语言模型的文本挖掘方法可在无需深入专业领域知识的情况下,揭示有意义且具有历史相关性的关联。

提出的方法

  • 利用预训练语言模型识别并从地方志文本中提取传记实体,如姓名、官衔和家族关系。
  • 应用针对文言文历史散文定制的命名实体识别(NER)与关系抽取技术。
  • 利用神经语言模型生成的上下文嵌入,提升在低资源、历史中文文本中的识别准确率。
  • 采用基于规则的后处理流程,验证并标准化提取的实体,转换为适用于数据库集成的标准格式。
  • 将挖掘出的数据整合至中国传记数据库,支持对亲属关系与官职关联的网络分析。
  • 通过与现有手工校对数据库(如中央研究院的中央政府官员姓名数据库)对比,验证结果的可靠性。

实验结果

研究问题

  • RQ1基于语言模型的自然语言处理技术能否有效从文言文地方志中提取传记实体?
  • RQ2此类模型在历史中文文本中识别官员、亲属关系与官职的准确度如何?
  • RQ3与人工数据收集相比,自动化挖掘在历史数据库中的可扩展性与一致性如何?
  • RQ4挖掘出的数据在多大程度上揭示了历史人物之间新的社会与地理关联?

主要发现

  • 该方法成功以高精度从地方志中提取传记数据,实现了中国传记数据库的系统性扩展。
  • 语言模型显著减少了人工校对时间,同时在识别文言文中姓名、官职与亲属关系方面保持了高准确率。
  • 该方法揭示了多个省份和朝代中官员与地方精英之间此前未被记录的社会与地理关联。
  • 将挖掘数据整合至数据库后,揭示了地方官员亲属网络与仕途轨迹的新模式。
  • 结果表明,自动化文本挖掘可作为传统历史研究方法的可扩展且可靠的补充手段。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。