Skip to main content
QUICK REVIEW

[论文解读] Deep Learning based Isolated Arabic Scene Character Recognition

Saad Bin Ahmed, Saeeda Naz|arXiv (Cornell University)|Apr 22, 2017
Handwritten Text Recognition Techniques被引用 6
一句话总结

本文提出一种基于卷积神经网络(ConvNets)的深度学习方法,用于孤立阿拉伯语场景字符识别,解决了倾斜、方向变化及草书书写复杂性等挑战。通过采用3×3和5×5卷积核,并优化步长与学习率设置,该方法在阿拉伯语场景文本图像子集上实现了14.57%的错误率,表明其在草书识别方面表现优异,尽管公开数据集有限。

ABSTRACT

The technological advancement and sophistication in cameras and gadgets prompt researchers to have focus on image analysis and text understanding. The deep learning techniques demonstrated well to assess the potential for classifying text from natural scene images as reported in recent years. There are variety of deep learning approaches that prospects the detection and recognition of text, effectively from images. In this work, we presented Arabic scene text recognition using Convolutional Neural Networks (ConvNets) as a deep learning classifier. As the scene text data is slanted and skewed, thus to deal with maximum variations, we employ five orientations with respect to single occurrence of a character. The training is formulated by keeping filter size 3 x 3 and 5 x 5 with stride value as 1 and 2. During text classification phase, we trained network with distinct learning rates. Our approach reported encouraging results on recognition of Arabic characters from segmented Arabic scene images.

研究动机与目标

  • 为解决在自然场景图像中识别孤立阿拉伯字母的挑战,这些图像通常存在倾斜、噪声及方向变化。
  • 评估ConvNets在识别阿拉伯语等草书文字方面的有效性,此类文字因上下文形状变化及缺乏词间距而具有识别难度。
  • 通过显式预处理、方向增强和超参数调优,在自定义阿拉伯语场景文本数据集上提升识别准确率。
  • 通过整理和准备数据集,为阿拉伯语场景文本识别提供基准,以支持未来研究。

提出的方法

  • 该方法使用3×3和5×5卷积核大小、步长为1和2的ConvNets,并采用ReLU激活函数进行特征提取。
  • 训练过程中对每个字符使用五种不同方向,以应对场景图像中的倾斜和旋转变化。
  • 网络架构包含两层卷积层,后接全连接层,部分配置在每层卷积后应用最大池化操作。
  • 学习率通过经验调优,0.005时表现最佳,模型采用随机梯度下降进行训练。
  • 预处理确保分割后的阿拉伯字母具有统一表示,便于分类。
  • 该方法聚焦于实例级学习,提取详细的像素级特征,而非上下文序列模式。

实验结果

研究问题

  • RQ1尽管存在倾斜、噪声和方向变化,ConvNets能否有效识别自然场景图像中的孤立阿拉伯字母?
  • RQ2不同卷积核大小(3×3与5×5)及学习率值如何影响阿拉伯语场景文本的识别准确率?
  • RQ3为最小化阿拉伯语场景文本识别中的错误率,卷积核大小、步长与学习率的最佳组合是什么?
  • RQ4方向增强如何提升阿拉伯字母在非约束环境下的识别性能?

主要发现

  • 当学习率为0.005时,3×3卷积核配置实现了最低错误率14.57%,优于5×5卷积核配置。
  • 每个字符使用五种方向变体显著提升了对场景图像中倾斜和旋转的鲁棒性。
  • 在每层卷积后应用最大池化并增加一个额外全连接层,可将错误率降低至19.57%,相比基线设置的27.01%有显著改善。
  • 该模型在阿拉伯语场景文本图像子集上实现了14.57%的错误率,表明其在草书识别方面具有强大潜力。
  • 结果表明,较小的卷积核能捕捉更多细节特征,尤其适用于带符号或结构复杂的字符。
  • 所提方法优于现有基于SIFT的方法,在阿拉伯语场景文本识别中错误率低于Tounsi等[23]报告的0.24。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。