Skip to main content
QUICK REVIEW

[论文解读] System Description of CITlab's Recognition & Retrieval Engine for ICDAR2017 Competition on Information Extraction in Historical Handwritten Records.

Tobias Strauß, Max Weidemann|arXiv (Cornell University)|Apr 26, 2018
Handwritten Text Recognition Techniques参考文献 5被引用 5
一句话总结

本论文针对ICDAR2017竞赛中的17世纪手写婚姻记录,提出了一套基于深度学习的识别与检索系统。系统采用CNN-BLSTM架构并结合CTC损失进行文本识别,随后通过人工设计的正则表达式与语言先验进行解码,以高精度提取结构化数据(如姓名、地点)。在丈夫姓名识别上达到96.17%的字符错误率(CER),妻子姓名识别达到98.49%的CER。

ABSTRACT

We present a recognition and retrieval system for the ICDAR2017 Competition on Information Extraction in Historical Handwritten Records which successfully infers person names and other data from marriage records. The system extracts information from the line images with a high accuracy and outperforms the baseline. The optical model is based on Neural Networks. To infer the desired information, regular expressions are used to describe the set of feasible words sequences.

研究动机与目标

  • 开发一种在标注训练数据有限的情况下,从历史手写文档中进行信息提取的鲁棒系统。
  • 应对早期现代西班牙文手写记录中语言变体与拼写不一致的挑战。
  • 提升从行级图像中识别个人元数据(如姓名、姓氏、地点)的准确性。
  • 展示结合神经序列识别与基于正则表达式及词汇先验的结构化规则解码的有效性。

提出的方法

  • 使用CTC损失在预处理的行图像上训练带有批量归一化和Dropout的CNN-BLSTM神经网络,实现序列到序列的文本识别。
  • 图像经过预处理,包括对比度增强、尺寸归一化以及专有的书写归一化,以将行高统一为96px并居中。
  • 系统通过两阶段过程解码网络输出的概率矩阵:首先,利用正则表达式将记录分割为区域(如丈夫、妻子);其次,使用词汇先验的子自动机对每位人物的序列进行验证。
  • 通过训练数据中的相对词频估计字符级先验,并通过每个位置的字符概率处理未登录词。
  • 最终解码序列通过最大化神经网络置信度与序列先验概率的乘积来确定,该乘积通过子词频率近似计算。
  • 系统使用自定义自动机,其中包含针对名字、姓氏、职业和地点的字典子自动机,以引导解码并提高可靠性。

实验结果

研究问题

  • RQ1结合深度学习与基于规则的正则表达式,能否在噪声大、历史特征明显的手写记录中实现高精度的结构化元数据提取?
  • RQ2在早期现代西班牙文手写体中,使用词汇先验与字符级语言模型在提升对罕见或变体形式识别方面的有效性如何?
  • RQ3人工设计正则表达式在多大程度上限制了系统的可扩展性?是否可通过自动或学习到的模式发现方法加以缓解?
  • RQ4姓名与姓氏的语言变体如何影响识别性能?结构化解码在多大程度上可减少错误传播?

主要发现

  • 系统在丈夫姓名识别上达到96.17%的字符错误率(CER),表明对个人标识符的识别具有高精度。
  • 妻子姓名识别的CER为98.49%,优于大多数其他类别,表明在结构良好条目中表现强劲。
  • 系统在妻子姓氏(CER 36.57%)和妻子母亲姓名(CER 0)等类别上表现不佳,因这些类别在训练数据中代表性不足,且正则表达式未能有效建模。
  • 丈夫母亲姓名及其他人员状态的识别效果也较差(CER 0),表明这些类别在训练集中可能缺失或表示不一致。
  • 系统对人工设计的正则表达式的依赖,限制了其在低频或格式不规则字段上的性能,凸显了该流水线中的关键瓶颈。
  • 尽管存在这些局限,整体方法在核心字段上表现优异,最佳系统总得分为91.56,略低于词级基线,但仍具高度竞争力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。