[论文解读] Unconstrained Scene Text and Video Text Recognition for Arabic Script
本文提出了一种端到端可训练的CNN-RNN混合模型,用于无约束阿拉伯语场景和视频文本识别,利用合成数据克服真实世界标注数据有限的问题。该模型在视频文本基准测试中达到最先进性能,并基于新引入的数据集建立了首个阿拉伯语场景文本识别的词级别基线。
Building robust recognizers for Arabic has always been challenging. We demonstrate the effectiveness of an end-to-end trainable CNN-RNN hybrid architecture in recognizing Arabic text in videos and natural scenes. We outperform previous state-of-the-art on two publicly available video text datasets - ALIF and ACTIV. For the scene text recognition task, we introduce a new Arabic scene text dataset and establish baseline results. For scripts like Arabic, a major challenge in developing robust recognizers is the lack of large quantity of annotated data. We overcome this by synthesising millions of Arabic text images from a large vocabulary of Arabic words and phrases. Our implementation is built on top of the model introduced here [37] which is proven quite effective for English scene text recognition. The model follows a segmentation-free, sequence to sequence transcription approach. The network transcribes a sequence of convolutional features from the input image to a sequence of target labels. This does away with the need for segmenting input image into constituent characters/glyphs, which is often difficult for Arabic script. Further, the ability of RNNs to model contextual dependencies yields superior recognition results.
研究动机与目标
- 解决场景和视频文本识别中阿拉伯语文本大规模标注数据不足的问题。
- 开发一种无需分割的序列到序列方法,以实现鲁棒的阿拉伯语文本识别。
- 引入一个新的阿拉伯语场景文本数据集,并为词级别识别建立基线性能。
- 在光照变化、形变和字体样式多变的非约束环境中提升识别准确率。
- 证明合成数据与端到端训练在阿拉伯语等低资源语言中的有效性。
提出的方法
- 该模型采用CNN-RNN混合架构,直接将输入图像特征转录为标签序列,无需进行字符级别的分割。
- 采用序列到序列学习框架,其中RNN用于建模字符间的上下文依赖关系。
- 从多样化词汇中大规模生成合成阿拉伯语文本图像,以增强训练数据。
- 使用AdaDelta优化器和RNN的反向传播通过时间(BPTT)方法,进行端到端训练。
- 采用连接时序分类(CTC)损失进行序列对齐,实现无需对齐的训练。
- 通过卷积层进行特征提取,随后使用双向LSTM层建模长距离依赖关系。
实验结果
研究问题
- RQ1端到端CNN-RNN架构是否能在阿拉伯语视频和场景文本识别中超越先前方法?
- RQ2合成数据生成在提升低资源阿拉伯语文本识别性能方面有多有效?
- RQ3阿拉伯语视频文本识别与场景文本识别之间的性能差距是什么?导致这一差异的因素有哪些?
- RQ4无分割方法是否能相比传统基于分割的模型在阿拉伯语书写系统中取得更优结果?
- RQ5在该领域此前无相关工作的前提下,能否为词级别阿拉伯语场景文本识别建立基线性能?
主要发现
- 所提出的CNN-RNN模型在ALIF test1数据集上实现了98.17%的字符识别率(CRR),创下阿拉伯语视频文本识别的新最先进水平。
- 在ALIF test2和AcTiV数据集上,模型分别实现了97.84%和97.44%的CRR,优于先前方法。
- 对于新引入的阿拉伯语场景文本数据集,模型实现了75.05%的CRR和39.43%的词识别率(WRR),首次建立了词级别识别的基线。
- 在场景文本数据集上,模型显著优于Tesseract OCR(CRR: 17.07%),证明了深度学习与合成数据的有效性。
- 结果表明,由于光照、形变和排版的更大变异性,场景文本识别比视频文本识别更具挑战性。
- 消融实验结果证实,结合合成数据的端到端训练能显著提升阿拉伯语文本识别的泛化能力与上下文建模能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。