[论文解读] Fully Convolutional Recurrent Network for Handwritten Chinese Text Recognition
本文提出了一种全卷积循环网络(FCRN)用于端到端的手写中文文本识别,利用路径签名编码笔尖轨迹,并采用双向LSTM结合优化的束搜索进行语言模型解码。该方法在CASIA-OLHWDB上达到96.40%的正确率,在ICDAR 2013上达到95.00%,性能达到当前最先进水平。
This paper proposes an end-to-end framework, namely fully convolutional recurrent network (FCRN) for handwritten Chinese text recognition (HCTR). Unlike traditional methods that rely heavily on segmentation, our FCRN is trained with online text data directly and learns to associate the pen-tip trajectory with a sequence of characters. FCRN consists of four parts: a path-signature layer to extract signature features from the input pen-tip trajectory, a fully convolutional network to learn informative representation, a sequence modeling layer to make per-frame predictions on the input sequence and a transcription layer to translate the predictions into a label sequence. The FCRN is end-to-end trainable in contrast to conventional methods whose components are separately trained and tuned. We also present a refined beam search method that efficiently integrates the language model to decode the FCRN and significantly improve the recognition results. We evaluate the performance of the proposed method on the test sets from the databases CASIA-OLHWDB and ICDAR 2013 Chinese handwriting recognition competition, and both achieve state-of-the-art performance with correct rates of 96.40% and 95.00%, respectively.
研究动机与目标
- 开发一种端到端的手写中文文本识别框架,通过直接建模笔尖轨迹避免分割操作。
- 通过在解码过程中集成语言模型并采用优化的束搜索,提升识别准确率。
- 评估在不同截断级别下路径签名对捕捉动态手写特征的有效性。
- 在不依赖过度分割或复杂图结构方法的前提下,实现在基准数据集上的最先进性能。
- 研究大规模语言模型语料对序列识别中错误率降低的影响。
提出的方法
- FCRN使用路径签名层生成 2^{n+1}-1 个特征图,以唯一表示在线手写数据中笔尖轨迹的动力学特性。
- 全卷积网络处理签名特征图,生成每个对应126×62感受野的上下文特征序列。
- 多层双向LSTM处理特征序列,预测每帧的字符概率,以建模轨迹中的长程依赖关系。
- 转录层通过结合语言模型约束的优化束搜索方法,将每帧预测解码为最终标签序列。
- 优化的束搜索方法高效结合n-gram语言模型与FCRN输出,通过引入词汇和语言上下文提升解码准确率。
- 整个网络通过最小化真实标签序列的负对数似然实现端到端训练。
实验结果
研究问题
- RQ1全卷积循环网络是否能通过建模原始笔尖轨迹,在不进行分割的情况下有效识别手写中文文本?
- RQ2在不同截断级别(n=0至n=3)下,路径签名表示对识别性能和计算成本的影响如何?
- RQ3通过束搜索集成语言模型,在端到端HCTR系统中能在多大程度上提升识别准确率?
- RQ4与较小语料相比,使用更大更丰富的语言模型语料(如包含5600万字符的SLD语料)是否能显著降低错误率?
- RQ5所提出的FCRN在CASIA-OLHWDB和ICDAR 2013等标准基准上的表现与先前最先进方法相比如何?
主要发现
- 在路径签名截断至第二级(Sig2)时,FCRN在性能与计算成本之间达到最佳平衡,在CASIA-OLHWDB上取得94.52%的正确率,在D-Com上达到89.86%。
- 结合基于SLD语料的三元语言模型后,CASIA-OLHWDB的正确率提升至96.40%,D-Com上达到95.00%,在两个数据集上均优于所有先前方法。
- 优化的束搜索方法显著提升了识别效果,集成语言模型后错误率降低2%-5%。
- 在CASIA-OLHWDB上,FCRN相比CRNN基线模型提升4.58个百分点,在D-Com上提升4.95个百分点,证明了路径签名与端到端学习的优势。
- 该系统在两个基准数据集上均达到最先进性能,CASIA-OLHWDB上正确率最高(96.40%),在ICDAR 2013上也取得优异结果(95.00%)。
- 在D-Casia上的性能高于D-Com,原因在于字符分布不平衡,提示需通过数据增强提升泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。