[论文解读] An Efficient End-to-End Neural Model for Handwritten Text Recognition
本文提出了一种端到端、高效的神经网络模型,用于离线手写文本识别,通过结合卷积神经网络(CNN)进行特征提取,以及使用批量归一化和层归一化、焦点损失和束搜索增强的编码器-解码器RNN架构。该模型在IAM数据集(+3.5%)和RIMES数据集(+1.1%)上实现了最先进的词级准确率,同时通过将输入图像下采样至原始尺寸的1/16,将计算量减少61%,内存使用量减少17%。
Offline handwritten text recognition from images is an important problem for enterprises attempting to digitize large volumes of handmarked scanned documents/reports. Deep recurrent models such as Multi-dimensional LSTMs have been shown to yield superior performance over traditional Hidden Markov Model based approaches that suffer from the Markov assumption and therefore lack the representational power of RNNs. In this paper we introduce a novel approach that combines a deep convolutional network with a recurrent Encoder-Decoder network to map an image to a sequence of characters corresponding to the text present in the image. The entire model is trained end-to-end using Focal Loss, an improvement over the standard Cross-Entropy loss that addresses the class imbalance problem, inherent to text recognition. To enhance the decoding capacity of the model, Beam Search algorithm is employed which searches for the best sequence out of a set of hypotheses based on a joint distribution of individual characters. Our model takes as input a downsampled version of the original image thereby making it both computationally and memory efficient. The experimental results were benchmarked against two publicly available datasets, IAM and RIMES. We surpass the state-of-the-art word level accuracy on the evaluation set of both datasets by 3.5% & 1.1%, respectively.
研究动机与目标
- 开发一种高效、端到端的深度学习模型,用于离线手写文本识别,避免手工设计特征和分割步骤。
- 通过使用焦点损失缓解字符识别中的类别不平衡问题,并通过束搜索改进解码过程,以提升识别准确率。
- 通过输入图像下采样降低计算和内存开销,同时不损失识别准确率。
- 在IAM和RIMES等标准基准数据集上,实现比现有最先进方法更高的词级准确率。
提出的方法
- 模型使用深层卷积网络从下采样后的文本行图像中提取视觉特征,将输入尺寸减少至原始分辨率的1/16。
- 双向RNN编码器从特征图中捕捉空间和序列上下文信息,学习垂直和水平方向上的长期依赖关系。
- 带有注意力机制的指针-生成器风格解码器,通过在每个解码步骤关注相关编码器状态,生成字符序列。
- 模型采用焦点损失进行端到端训练,以缓解字符识别中固有的类别不平衡问题,特别是对罕见字符的识别。
- 应用批量归一化和层归一化以稳定训练过程并提升收敛性。
- 推理阶段使用束搜索,以探索多个假设序列,并基于联合字符概率选择最可能的输出序列。
实验结果
研究问题
- RQ1带有注意力机制的混合CNN-RNN编码器-解码器模型是否能在手写文本识别任务中超越标准的RNN-CTC架构?
- RQ2焦点损失在类别不平衡的字符识别任务中能多大程度上提升模型性能?
- RQ3与贪婪解码相比,束搜索在提升序列级准确率方面有多有效?
- RQ4通过输入图像下采样是否能显著降低计算和内存使用量,同时不降低识别准确率?
- RQ5如批量归一化和层归一化等归一化技术是否能增强模型的稳定性和性能?
主要发现
- 该模型在IAM数据集上的词错误率(WER)为16.7%,在RIMES数据集上为9.6%,分别优于之前最先进方法3.5个百分点和1.1个百分点。
- 通过将输入图像下采样至原始尺寸的1/16,模型将计算成本降低61%,内存消耗减少17%,且准确率无显著下降。
- 束搜索的集成使词级准确率相比贪婪解码绝对提升了4-5%,证明其在序列生成中的有效性。
- 焦点损失和层归一化各自带来1-3%的性能提升,其中层归一化在不同数据集上表现最一致。
- 尽管字符错误率(CER)略高于最先进方法,但该模型实现了更高的词级准确率,表明其整体序列预测能力更强。
- 该模型在Nvidia Tesla K40 GPU上的单行推理时间为1.5秒,展示了其在实际部署中的高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。