Skip to main content
QUICK REVIEW

[论文解读] Named Entity Recognition and Classification on Historical Documents: A Survey

Maud Ehrmann, Ahmed Hamdi|arXiv (Cornell University)|Sep 23, 2021
Topic ModelingComputer Science参考文献 178被引用 20
一句话总结

本综述综合分析了历史文献中命名实体识别(NER)与分类所面临的挑战、可用资源及方法,重点指出了OCR错误、语言变异以及缺乏标准化数据集等问题。文章评估了现有的自然语言处理(NLP)方法——从传统机器学习到深度学习——并识别出关键的研究空白,主张通过改进数据整理、增强多语言支持以及实现领域特定的适应性,以推动数字人文学科的发展。

ABSTRACT

After decades of massive digitisation, an unprecedented amount of historical documents is available in digital format, along with their machine-readable texts. While this represents a major step forward with respect to preservation and accessibility, it also opens up new opportunities in terms of content mining and the next fundamental challenge is to develop appropriate technologies to efficiently search, retrieve and explore information from this 'big data of the past'. Among semantic indexing opportunities, the recognition and classification of named entities are in great demand among humanities scholars. Yet, named entity recognition (NER) systems are heavily challenged with diverse, historical and noisy inputs. In this survey, we present the array of challenges posed by historical documents to NER, inventory existing resources, describe the main approaches deployed so far, and identify key priorities for future developments.

研究动机与目标

  • 应对数字化历史文献中语义索引日益增长的需求,以实现高效的信息检索与探索。
  • 识别历史文本NER中的核心挑战,包括OCR噪声、语言变异以及缺乏标准化标注。
  • 盘点专为历史文献处理而设计的现有数据集、工具及NLP技术。
  • 评估当前NER方法(尤其是深度学习与迁移学习)在历史语料上的性能与局限性。
  • 提出未来研究的关键优先事项,如改进数据整理、增强多语言支持以及实现领域特定的适应性。

提出的方法

  • 系统性地调研2000年至2021年间与历史文献NER相关的同行评审文献、数据集及工具。
  • 根据其基础技术对NER方法进行分类与分析:规则基础方法、机器学习方法(如CRF、SVM)以及深度学习方法(如BERT、BiLSTM-CRF)。
  • 评估OCR质量与HTR错误对NER性能的影响,强调事后校正与标准化技术的重要性。
  • 探讨迁移学习与预训练语言模型在低资源历史语言NER中的作用。
  • 评估多语言与跨语言NER在历史语境下的有效性,尤其针对代表性不足的语言。
  • 将研究发现整合为一个面向未来NER发展的框架,强调数据质量、标注标准与工具互操作性。

实验结果

研究问题

  • RQ1在历史文献中应用NER的主要挑战是什么,特别是OCR错误与语言变异方面?
  • RQ2哪些现有的数据集与工具在历史文本NER中最为有效,其局限性是什么?
  • RQ3不同NLP技术——尤其是深度学习模型——在历史文献语料上的表现与现代文本相比如何?
  • RQ4迁移学习与多语言预训练模型在低资源历史语言NER中的表现提升程度如何?
  • RQ5在数字人文领域,历史文献NER研究中存在哪些关键空白与未来优先事项?

主要发现

  • OCR与HTR错误显著降低NER性能,研究表明高达30%的命名实体因转录错误而被错误识别。
  • 传统机器学习模型(如CRF与SVM)在经过清理、低噪声的数据集上仍具有效性,但在噪声较大或语言变异严重的文本中表现不佳。
  • 深度学习模型,尤其是微调后的BERT架构,在大多数历史NER基准测试中优于传统方法,尤其当在相关历史语料上进行预训练时。
  • 多语言与跨语言模型展现出潜力,但需对历史语言形式进行仔细调整,特别是针对非现代或罕见语言变体。
  • 缺乏标准化、高质量且多语言的标注数据集,仍是训练和评估稳健历史文献NER系统的主要瓶颈。
  • 对OCR输出进行事后校正可在某些情况下将NER性能提升高达20%,表明预处理在实现可靠实体识别中至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。