Skip to main content
QUICK REVIEW

[论文解读] Handwritten Arabic Numeral Recognition using Deep Learning Neural Networks

Akm Ashiquzzaman, Abdul Kawsar Tushar|arXiv (Cornell University)|Feb 15, 2017
Handwritten Text Recognition Techniques参考文献 6被引用 8
一句话总结

本文提出了一种基于深度学习的手写阿拉伯数字识别方法,采用带有ReLU激活函数和Dropout正则化的卷积神经网络(CNN),在CMATERDB 3.3.1数据集上实现了97.4%的准确率——超越了以往方法。此外,通过将Sigmoid替换为ReLU并增加Dropout,改进了Das等人提出的MLP模型,在保持93.8%准确率的同时减少了过拟合现象。

ABSTRACT

Handwritten character recognition is an active area of research with applications in numerous fields. Past and recent works in this field have concentrated on various languages. Arabic is one language where the scope of research is still widespread, with it being one of the most popular languages in the world and being syntactically different from other major languages. Das et al. \cite{DBLP:journals/corr/abs-1003-1891} has pioneered the research for handwritten digit recognition in Arabic. In this paper, we propose a novel algorithm based on deep learning neural networks using appropriate activation function and regularization layer, which shows significantly improved accuracy compared to the existing Arabic numeral recognition methods. The proposed model gives 97.4 percent accuracy, which is the recorded highest accuracy of the dataset used in the experiment. We also propose a modification of the method described in \cite{DBLP:journals/corr/abs-1003-1891}, where our method scores identical accuracy as that of \cite{DBLP:journals/corr/abs-1003-1891}, with the value of 93.8 percent.

研究动机与目标

  • 提升手写阿拉伯数字识别的准确率,超越现有方法。
  • 通过Dropout正则化缓解以往基于MLP方法中的过拟合问题。
  • 在相同数据集上评估CNN模型与改进后MLP模型的性能表现。
  • 证明通过CNN实现的端到端特征学习优于手工设计的特征选择。

提出的方法

  • 使用包含多个卷积层的CNN架构,每个卷积层后接ReLU激活函数和最大池化操作,从32×32灰度图像中提取分层特征。
  • 将最终的特征图展平后输入包含128个神经元的全连接层,并使用ReLU激活函数,随后通过50%的Dropout层以防止过拟合。
  • 输出层包含10个神经元,采用Softmax激活函数,用于预测数字0–9的类别概率。
  • 模型使用分类交叉熵损失函数和Adadelta优化器进行训练,共训练1000个周期,批量大小为128。
  • MLP变体将CNN替换为全连接网络,输入层和隐藏层均使用ReLU激活函数,隐藏层应用25%的Dropout,输出层保持相同的10分类Softmax结构。
  • 两个模型均使用完整的1024像素输入,未采用预选特征,与以往研究中使用的88个手工设计特征不同。

实验结果

研究问题

  • RQ1基于CNN的模型能否在手写阿拉伯数字识别任务中实现高于以往MLP方法的准确率?
  • RQ2Dropout正则化在阿拉伯数字识别模型中减少过拟合的效率如何?
  • RQ3在该任务中,CNN的端到端特征学习是否优于手工特征提取?
  • RQ4标准MLP与CNN在相同阿拉伯数字数据集上的性能差距有多大?

主要发现

  • 所提出的CNN模型在测试集上达到了97.4%的准确率,为CMATERDB 3.3.1数据集上报告的最高准确率。
  • 改进后的MLP模型达到了93.8%的准确率,与Das等人[1]提出的方法性能相当,但正则化效果更优。
  • CNN模型显著优于原始MLP和改进后的MLP,证明了卷积特征学习的优越性。
  • ReLU激活函数与Dropout正则化的结合在两个模型中均有效缓解了过拟合问题。
  • CNN在特征提取方面的计算优势通过其在全连接网络上持续的性能提升得到验证。
  • 结果表明,使用原始像素输入并配合适当正则化的深度学习模型,可超越依赖手工特征的传统方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。