Skip to main content
QUICK REVIEW

[论文解读] StackMix and Blot Augmentations for Handwritten Text Recognition

Alex Shonenkov, Denis Karachev|arXiv (Cornell University)|Aug 26, 2021
Handwritten Text Recognition Techniques参考文献 24被引用 11
一句话总结

该论文提出了一种新颖的手写文本识别(HTR)系统,在多个基准数据集(包括IAM、Bentham、Saint Gall、Digital Peter和HKR)上超越了当前最先进模型的性能。该方法结合了经过修改的ResNet-34主干网络与两种数据增强技术——通过模拟划线效果来生成手写笔迹缺陷的Handwritten Blots,以及通过混合印刷体与手写体文本生成合成训练样本的StackMix——在BenthamR0上实现了1.73%的新SOTA词错误率(CER),在Saint Gall上实现了3.65%的CER。

ABSTRACT

This paper proposes a handwritten text recognition(HTR) system that outperforms current state-of-the-artmethods. The comparison was carried out on three of themost frequently used in HTR task datasets, namely Ben-tham, IAM, and Saint Gall. In addition, the results on tworecently presented datasets, Peter the Greats manuscriptsand HKR Dataset, are provided.The paper describes the architecture of the neural net-work and two ways of increasing the volume of train-ing data: augmentation that simulates strikethrough text(HandWritten Blots) and a new text generation method(StackMix), which proved to be very effective in HTR tasks.StackMix can also be applied to the standalone task of gen-erating handwritten text based on printed text.

研究动机与目标

  • 解决历史手写文档识别中因专家标注成本高、耗时长而导致的标注数据有限问题。
  • 通过增强训练数据的多样性与鲁棒性,提升在低资源及历史手写风格多变数据集上的识别准确率。
  • 开发一种可扩展的HTR系统,能够高效处理大规模历史手稿,减少对手动解码的依赖。
  • 引入可模拟真实手写缺陷的数据增强技术,提升模型泛化能力,且无需额外标注。
  • 在多个基准数据集上实现最先进性能,包括近期及专用数据集(如彼得大帝手稿和HKR)

提出的方法

  • 采用修改后的ResNet-34架构,第一层使用步长为1的卷积以保留空间分辨率,随后接AdaptiveAvgPool2d和三个BiLSTM层用于序列建模。
  • 提出Handwritten Blots——一种数据增强方法,通过在手写行上应用逼真的墨渍斑点效果,模拟划线文本,提升对墨水缺陷的鲁棒性。
  • 提出StackMix——一种新颖的增强技术,通过学习到的混合策略将印刷体文本与手写图像混合,生成合成训练样本,有效提升训练数据多样性。
  • 使用CTC损失进行端到端序列到序列学习,实现对转录准确率的直接优化。
  • 在行级识别设置下应用模型,处理128×2048像素图像,并使用标准指标(CER、WER和准确率)进行评估。
  • 在所有实验中采用一致的数据划分,以确保与先前工作的公平比较,尤其在IAM数据集上存在多种划分方式的情况下。

实验结果

研究问题

  • RQ1像StackMix和Handwritten Blots这样的合成数据增强技术,是否能在低资源和历史手写数据集上显著提升HTR性能?
  • RQ2在多种数据集上,StackMix与Handwritten Blots的组合相较于标准数据增强和基线模型,在CER和WER方面表现如何?
  • RQ3该系统在仅需少量标注数据的情况下,能否通过高精度推理显著降低手动标注成本,实现对大规模历史手稿的自动化处理?
  • RQ4该模型在不同手写风格和语言(包括现代与历史文字)之间是否具备良好泛化能力,如在IAM、Bentham和Saint Gall上的表现所示?
  • RQ5该系统在推理速度上与现有模型相比如何,尤其是在训练阶段使用复杂增强技术的情况下?

主要发现

  • 所提模型在BenthamR0数据集上实现了1.73% ± 0.02的新SOTA词错误率(CER),显著优于先前方法(例如[11]中的3.98%),并接近2016年SOTA模型的3.5% CER。
  • 在IAM-B数据集上,模型达到3.77% CER和12.8% WER,与2016年SOTA模型的3.5% CER非常接近,展现出在广泛使用基准上的强劲性能。
  • 在Saint Gall数据集上,模型实现3.65% CER,优于此前最佳结果5.26% CER,表明其在高度多变的历史手写体上的强大泛化能力。
  • 所有增强技术(StackMix + Blots + 标准增强)的组合使BenthamR0上的CER降至1.73%,Saint Gall上降至3.65%,表明多种增强策略之间存在协同增益。
  • 在单张Tesla V100 GPU上,模型实现每秒95行的推理速度,可实现每分钟380页的自动化处理——远快于人工史学家团队(662页需3个月)。
  • 在Digital Peter数据集上,模型达到2.50% CER和14.6% WER,优于此前SOTA的10.5% CER,证明其在罕见且复杂历史文字上的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。