[论文解读] End-to-end Handwritten Paragraph Text Recognition Using a Vertical Attention Network
该论文提出了一种新颖的端到端、无需分割的手写段落识别模型,采用垂直注意力网络(VAN),利用混合(内容与位置相关)注意力机制隐式分割文本行并按顺序解码文本。该方法在 RIMES 上实现了 1.91% 的字符错误率,在 IAM 上为 4.45%,在 READ 2016 上为 3.59%,展现出卓越性能,且无需显式行分割或多阶段训练。
Unconstrained handwritten text recognition remains challenging for computer vision systems. Paragraph text recognition is traditionally achieved by two models: the first one for line segmentation and the second one for text line recognition. We propose a unified end-to-end model using hybrid attention to tackle this task. This model is designed to iteratively process a paragraph image line by line. It can be split into three modules. An encoder generates feature maps from the whole paragraph image. Then, an attention module recurrently generates a vertical weighted mask enabling to focus on the current text line features. This way, it performs a kind of implicit line segmentation. For each text line features, a decoder module recognizes the character sequence associated, leading to the recognition of a whole paragraph. We achieve state-of-the-art character error rate at paragraph level on three popular datasets: 1.91% for RIMES, 4.45% for IAM and 3.59% for READ 2016. Our code and trained model weights are available at https://github.com/FactoDeepLearning/VerticalAttentionOCR.
研究动机与目标
- 解决传统两阶段手写段落识别系统依赖显式行分割且易产生误差累积的局限性。
- 消除训练过程中对昂贵且人工标注的行级分割标签的需求。
- 通过注意力机制将行分割与文本识别统一为一个端到端可训练的模型。
- 通过循环注意力机制隐式学习阅读顺序与文本行定位。
- 通过在行图像上预训练以提升识别准确率与收敛速度,同时保持完整的段落级推理能力。
提出的方法
- 编码器基于全卷积网络,从整个段落图像中提取二维特征图,保留空间信息与字符级特征。
- 混合注意力机制生成垂直加权掩码,聚焦于特定特征行,实现隐式行定位与分割。
- 注意力机制为循环结构,按阅读顺序一次处理一行,结合内容与位置信息。
- 解码器采用循环神经网络,从每个关注行的表示中转录字符序列。
- 训练过程中使用连接时序分类(CTC)损失,将预测序列与真实转录对齐。
- 通过在行图像上预训练,提升收敛速度与最终识别准确率,随后在完整段落数据上微调。
实验结果
研究问题
- RQ1单一神经网络能否在无需显式分割监督的情况下,有效实现手写段落中隐式行分割与文本识别?
- RQ2结合内容与位置信息的混合注意力机制相比标准注意力机制,在段落级识别中表现如何提升?
- RQ3在行图像上预训练在多大程度上提升了端到端段落识别模型的性能?
- RQ4端到端、无需分割的方法在准确率与鲁棒性方面能否超越传统两阶段系统?
- RQ5该模型在缺乏显式版式建模的情况下,对多样的版式变化(如可变行间距与倾斜)泛化能力如何?
主要发现
- 所提出的垂直注意力网络在 RIMES 数据集上实现了 1.91% 的最先进字符错误率,优于先前方法。
- 在 IAM 数据集上,模型达到 4.45% 的字符错误率,展现出对不同手写风格的强大泛化能力。
- 在 READ 2016 数据集上,模型实现 3.59% 的字符错误率,证实其在具有挑战性的实际段落图像上的有效性。
- 通过消除独立的行分割与识别阶段,显著减少了误差累积。
- 在行图像上预训练提升了收敛速度与最终识别准确率,是模型卓越性能的重要贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。