[论文解读] StackMix and Blot Augmentations for Handwritten Text Recognition
该论文提出了一种新颖的手写文本识别(HTR)系统,在多个基准数据集(包括IAM、Bentham、Saint Gall、Digital Peter和HKR)上超越了当前最先进模型的性能。该方法结合了经过修改的ResNet-34主干网络与两种数据增强技术——通过模拟划线效果来生成手写笔迹缺陷的Handwritten Blots,以及通过混合印刷体与手写体文本生成合成训练样本的StackMix——在BenthamR0上实现了1.73%的新SOTA词错误率(CER),在Saint Gall上实现了3.65%的CER。
This paper proposes a handwritten text recognition(HTR) system that outperforms current state-of-the-artmethods. The comparison was carried out on three of themost frequently used in HTR task datasets, namely Ben-tham, IAM, and Saint Gall. In addition, the results on tworecently presented datasets, Peter the Greats manuscriptsand HKR Dataset, are provided.The paper describes the architecture of the neural net-work and two ways of increasing the volume of train-ing data: augmentation that simulates strikethrough text(HandWritten Blots) and a new text generation method(StackMix), which proved to be very effective in HTR tasks.StackMix can also be applied to the standalone task of gen-erating handwritten text based on printed text.
研究动机与目标
- 解决历史手写文档识别中因专家标注成本高、耗时长而导致的标注数据有限问题。
- 通过增强训练数据的多样性与鲁棒性,提升在低资源及历史手写风格多变数据集上的识别准确率。
- 开发一种可扩展的HTR系统,能够高效处理大规模历史手稿,减少对手动解码的依赖。
- 引入可模拟真实手写缺陷的数据增强技术,提升模型泛化能力,且无需额外标注。
- 在多个基准数据集上实现最先进性能,包括近期及专用数据集(如彼得大帝手稿和HKR)
提出的方法
- 采用修改后的ResNet-34架构,第一层使用步长为1的卷积以保留空间分辨率,随后接AdaptiveAvgPool2d和三个BiLSTM层用于序列建模。
- 提出Handwritten Blots——一种数据增强方法,通过在手写行上应用逼真的墨渍斑点效果,模拟划线文本,提升对墨水缺陷的鲁棒性。
- 提出StackMix——一种新颖的增强技术,通过学习到的混合策略将印刷体文本与手写图像混合,生成合成训练样本,有效提升训练数据多样性。
- 使用CTC损失进行端到端序列到序列学习,实现对转录准确率的直接优化。
- 在行级识别设置下应用模型,处理128×2048像素图像,并使用标准指标(CER、WER和准确率)进行评估。
- 在所有实验中采用一致的数据划分,以确保与先前工作的公平比较,尤其在IAM数据集上存在多种划分方式的情况下。
实验结果
研究问题
- RQ1像StackMix和Handwritten Blots这样的合成数据增强技术,是否能在低资源和历史手写数据集上显著提升HTR性能?
- RQ2在多种数据集上,StackMix与Handwritten Blots的组合相较于标准数据增强和基线模型,在CER和WER方面表现如何?
- RQ3该系统在仅需少量标注数据的情况下,能否通过高精度推理显著降低手动标注成本,实现对大规模历史手稿的自动化处理?
- RQ4该模型在不同手写风格和语言(包括现代与历史文字)之间是否具备良好泛化能力,如在IAM、Bentham和Saint Gall上的表现所示?
- RQ5该系统在推理速度上与现有模型相比如何,尤其是在训练阶段使用复杂增强技术的情况下?
主要发现
- 所提模型在BenthamR0数据集上实现了1.73% ± 0.02的新SOTA词错误率(CER),显著优于先前方法(例如[11]中的3.98%),并接近2016年SOTA模型的3.5% CER。
- 在IAM-B数据集上,模型达到3.77% CER和12.8% WER,与2016年SOTA模型的3.5% CER非常接近,展现出在广泛使用基准上的强劲性能。
- 在Saint Gall数据集上,模型实现3.65% CER,优于此前最佳结果5.26% CER,表明其在高度多变的历史手写体上的强大泛化能力。
- 所有增强技术(StackMix + Blots + 标准增强)的组合使BenthamR0上的CER降至1.73%,Saint Gall上降至3.65%,表明多种增强策略之间存在协同增益。
- 在单张Tesla V100 GPU上,模型实现每秒95行的推理速度,可实现每分钟380页的自动化处理——远快于人工史学家团队(662页需3个月)。
- 在Digital Peter数据集上,模型达到2.50% CER和14.6% WER,优于此前SOTA的10.5% CER,证明其在罕见且复杂历史文字上的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。