[论文解读] Offline Handwritten Chinese Text Recognition with Convolutional Neural Networks
本文提出了一种无循环网络、基于卷积神经网络(CNN)的方法,采用连接时序分类(CTC)损失进行离线手写中文文本识别。通过应用高比例丢弃率和基于合成字符模板的数据增强,该方法在不使用语言模型校正的情况下,在ICDAR 2013基准测试中实现了最先进的6.81%字符错误率(CER)。
Deep learning based methods have been dominating the text recognition tasks in different and multilingual scenarios. The offline handwritten Chinese text recognition (HCTR) is one of the most challenging tasks because it involves thousands of characters, variant writing styles and complex data collection process. Recently, the recurrent-free architectures for text recognition appears to be competitive as its highly parallelism and comparable results. In this paper, we build the models using only the convolutional neural networks and use CTC as the loss function. To reduce the overfitting, we apply dropout after each max-pooling layer and with extreme high rate on the last one before the linear layer. The CASIA-HWDB database is selected to tune and evaluate the proposed models. With the existing text samples as templates, we randomly choose isolated character samples to synthesis more text samples for training. We finally achieve 6.81% character error rate (CER) on the ICDAR 2013 competition set, which is the best published result without language model correction.
研究动机与目标
- 为解决离线手写中文文本识别的挑战,该任务涉及数千个汉字且书写风格差异大。
- 开发一种无循环网络的架构,以实现高度并行化并提升训练效率。
- 通过策略性地应用丢弃层,减少在有限手写数据上训练模型时的过拟合。
- 通过利用现有文本模板生成合成训练样本,提升模型泛化能力。
- 在不依赖语言模型校正的前提下,实现在ICDAR 2013基准测试中的最先进性能。
提出的方法
- 模型仅使用卷积神经网络,摒弃循环层,以实现高度并行训练。
- 采用连接时序分类(CTC)作为损失函数,以处理序列到序列的对齐,而无需显式对齐。
- 在每个最大池化层后应用丢弃层,且在全连接分类器前的最终层使用极高比例的丢弃率,以缓解过拟合。
- 通过从现有文本样本中随机选取孤立字符,组合生成新的序列,以生成合成训练样本。
- 使用CASIA-HWDB数据集进行模型调优与评估,该数据集为中文手写提供了大规模基准。
- 通过模板化合成实现的数据增强,提升了训练多样性并增强了模型鲁棒性。
实验结果
研究问题
- RQ1纯卷积神经网络架构是否能在无循环组件的情况下实现离线手写中文文本识别的竞争力表现?
- RQ2在有限的手写中文数据集上,于最后一层应用高比例丢弃是否能有效减少过拟合?
- RQ3基于现有文本模板生成的合成数据在多大程度上能提升模型泛化能力和识别准确率?
- RQ4CTC损失函数是否能有效支持仅CNN模型在中文文本序列识别任务中的端到端训练?
- RQ5在不集成语言模型的前提下,纯CNN与CTC结合的模型在ICDAR 2013基准测试中的性能上限是什么?
主要发现
- 所提出的纯CNN模型在ICDAR 2013竞赛测试集上实现了6.81%的字符错误率(CER),是目前无需语言模型校正的最优报告结果。
- 在最后一层最大池化层后应用高比例丢弃,显著减少了在有限训练数据上的过拟合。
- 基于现有文本模板生成的合成数据有效增加了训练多样性,并提升了模型泛化能力。
- 无循环网络架构实现了高度并行训练,且在性能上与基于RNN的模型相比仍具竞争力。
- 该模型对中文手写文本中的风格差异和复杂书写模式表现出强鲁棒性。
- 结果证实,CTC损失在纯CNN架构的序列识别任务中,对端到端训练具有显著有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。