Skip to main content
QUICK REVIEW

[论文解读] Neural Word Search in Historical Manuscript Collections

Tomas Wilkinson, Jonas Lindström|arXiv (Cornell University)|Dec 6, 2018
Handwritten Text Recognition Techniques参考文献 78被引用 5
一句话总结

本文提出 Ctrl-F-Net,一种用于历史手稿中无分割查询字符串单词检索的深度学习模型,该模型联合生成区域建议并将其嵌入共享嵌入空间,以实现高效检索。仅在11页数据上进行训练,即可实现对超过10万页的大型历史研究,使数据收集速度提升数个数量级,并在基准数据集上超越了先前的最先进方法。

ABSTRACT

We address the problem of segmenting and retrieving word images in collections of historical manuscripts given a text query. This is commonly referred to as "word spotting". To this end, we first propose an end-to-end trainable model based on deep neural networks that we dub Ctrl-F-Net. The model simultaneously generates region proposals and embeds them into a word embedding space, wherein a search is performed. We further introduce a simplified version called Ctrl-F-Mini. It is faster with similar performance, though it is limited to more easily segmented manuscripts. We evaluate both models on common benchmark datasets and surpass the previous state of the art. Finally, in collaboration with historians, we employ the Ctrl-F-Net to search within a large manuscript collection of over 100 thousand pages, written across two centuries. With only 11 training pages, we enable large scale data collection in manuscript-based historical research. This results in a speed up of data collection and the number of manuscripts processed by orders of magnitude. Given the time consuming manual work required to study old manuscripts in the humanities, quick and robust tools for word spotting has the potential to revolutionise domains like history, religion and language.

研究动机与目标

  • 为解决在大规模手写历史手稿集合中手动搜索特定单词所面临的耗时问题,该问题限制了研究范围。
  • 开发一种可扩展的、基于深度学习的单词检索解决方案,无需对单个单词进行手动分割或转录。
  • 使历史学家仅通过文本查询即可高效定位未整理、噪声较多的手稿集合中的相关文本片段。
  • 证明在训练数据有限的情况下,对历史文字中未登录词实现零样本检索的可行性。
  • 通过将该方法应用于包含64卷、跨越两个世纪的大型未探索手稿集合,在真实历史研究中验证其有效性。

提出的方法

  • 所提出的 Ctrl-F-Net 模型使用深度卷积神经网络,同时生成区域建议并将它们嵌入共享的单词嵌入空间,以实现基于相似度的检索。
  • 区域建议通过类似 Faster R-CNN 的主干网络生成,随后通过共享的嵌入头将每个区域映射为密集向量表示。
  • 模型采用三元组损失并结合困难负样本挖掘进行端到端训练,以确保相关单词区域在嵌入空间中的距离比无关区域更近。
  • 为书写分割较简单的手稿,引入简化版本 Ctrl-F-Mini,以牺牲部分精度换取显著更快的推理速度。
  • 通过计算查询嵌入(由文本编码器生成)与区域嵌入之间的余弦相似度,实现基于字符串的查询检索。
  • 该方法在标准基准上进行评估,并应用于18至19世纪法院记录的10万页真实世界数据集,仅使用11页训练数据。

实验结果

研究问题

  • RQ1深度学习模型是否能够在不依赖手动单词分割或转录的情况下,实现对历史手稿中准确的单词检索?
  • RQ2所提出的端到端模型在仅使用文本查询的情况下,从大规模未整理手稿集合中检索相关单词实例的效率如何?
  • RQ3当在少量页面上进行训练时,模型对未登录词的泛化能力在多大程度上得以实现?
  • RQ4该模型在书写风格高度多变、墨水褪色和版面复杂的文档上的表现如何?
  • RQ5该模型是否能通过使从以往无法访问的手稿集合中实现大规模数据收集,从而显著加速历史研究?

主要发现

  • Ctrl-F-Net 在基准数据集上超越了先前的最先进方法,在 IAM 数据集上实现了 0.87 的平均平均精度(MAP),并在 Snevringe 法院记录数据集上超越了先前最先进水平。
  • 在 Snevringe 数据集上,模型在前1名的精确率为 0.70,前10名的精确率为 0.68(针对10个查询),对在词汇表内的单词表现优于未登录词(OOV)的单词。
  • 尽管仅在11页数据上进行训练,该模型仍成功从10万页的手稿集合中检索到相关单词实例,使数据收集速度比人工方法快数个数量级。
  • 模型在未登录词查询上表现出惊人的鲁棒性,对 'gifta'(意为“已婚”)的查询实现了高精确率,表明在训练数据有限的情况下仍具备有效的零样本泛化能力。
  • 定性结果表明,该模型能够处理多样的书写风格,包括 Kurrent 手写体,尽管由于训练数据中某些手写体的过度表示,偶尔会检索到错误实例。
  • 消融研究证实,区域建议的质量显著影响模型性能,因此设计了更轻量级的 Ctrl-F-Mini 变体,以实现对易于分割手稿的更快推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。