[论文解读] Offline handwritten mathematical symbol recognition utilising deep learning
本文提出了一种基于SLIC分割和预训练SqueezeNet迁移学习的深度学习框架,用于离线手写数学符号识别。该方法在101类符号上实现了90%的准确率,展示了在极少数据增强条件下的最先进性能。
This paper describes an approach for offline recognition of handwritten mathematical symbols. The process of symbol recognition in this paper includes symbol segmentation and accurate classification for over 300 classes. Many multidimensional mathematical symbols need both horizontal and vertical projection to be segmented. However, some symbols do not permit to be projected and stop segmentation, such as the root symbol. Besides, many mathematical symbols are structurally similar, specifically in handwritten such as 0 and null. There are more than 300 Mathematical symbols. Therefore, designing an accurate classifier for more than 300 classes is required. This paper initially addresses the issue regarding segmentation using Simple Linear Iterative Clustering (SLIC). Experimental results indicate that the accuracy of the designed kNN classifier is 84% for salient, 57% Histogram of Oriented Gradient (HOG), 53% for Linear Binary Pattern (LBP) and finally 43% for pixel intensity of raw image for 66 classes. 87 classes using modified LeNet represents 90% accuracy. Finally, for 101 classes, SqueezeNet ac
研究动机与目标
- 解决在离线手写表达式中识别300多个手写数学符号的挑战。
- 提高复杂、结构相似或非投影符号(如根号和零)的符号分割精度。
- 设计一种鲁棒的分类器,能够区分高度相似的符号(如0和空集符号,或大写与小写字母变体)。
- 通过使用预训练深度网络的迁移学习,在有限训练数据下实现高识别准确率。
- 评估并比较传统基于特征的方法(HOG、LBP、显著性、强度)与深度学习模型(LeNet、SqueezeNet)的性能。
提出的方法
- 使用简单线性迭代聚类(SLIC)进行符号分割,生成捕捉手写符号结构细节的超像素。
- 分类部分使用在66类和后续87类上训练的改进LeNet网络,通过调整超参数以实现最佳收敛和损失控制。
- 采用迁移学习方法,使用在101个数学符号类别上微调的预训练SqueezeNet模型,以缓解小样本数据下的过拟合问题。
- 网络采用ReLU激活函数、Softmax损失函数和ADAM优化器,学习率为0.00001,以实现稳定训练。
- 通过多种特征提取方法(原始像素强度、显著性图、HOG、LBP)进行性能评估,作为对比基线分析。
- 最终模型利用SqueezeNet的轻量化架构和18层深度,在减少参数量的同时保持高准确率。
实验结果
研究问题
- RQ1基于SLIC的超像素分割能否有效处理复杂且非投影的数学符号(如根号符号)?
- RQ2传统手工设计特征(HOG、LBP、显著性、强度)在多类数学符号识别中的性能与深度学习模型相比如何?
- RQ3使用预训练SqueezeNet进行迁移学习,在超过100类符号且数据量有限的数据集上,能在多大程度上提升识别准确率?
- RQ4哪些超参数设置(学习率、优化器、激活函数)能在该任务中实现深度网络的最佳收敛和准确率?
- RQ5深度学习模型(如LeNet和SqueezeNet)是否能在无需大量数据增强的情况下,对不断增长的符号类别实现高准确率(≥90%)?
主要发现
- kNN分类器在66类符号上使用显著性图达到84%准确率,使用HOG为57%,使用LBP为53%,使用原始像素强度为43%。
- 改进的LeNet网络在78类符号上使用ReLU激活函数、Softmax损失函数和ADAM优化器(学习率为0.00001)达到85%准确率。
- 通过迁移学习,预训练的SqueezeNet在101个数学符号类别上达到90%准确率,优于所有基线方法。
- ADAM优化器与低学习率(1e-5)的组合显著提升了收敛速度和最终准确率,优于SGD。
- 在深层网络(如改进的LeNet和SqueezeNet)中使用ReLU激活函数和Softmax损失函数,相比tanh和sigmoid,性能更优,因梯度消失问题更小。
- 使用SqueezeNet进行迁移学习使模型在有限训练数据下仍能实现90%的高性能,证明其在低数据量符号识别任务中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。