[论文解读] Sparse Concept Coded Tetrolet Transform for Unconstrained Odia Character Recognition
本文提出了一种用于无约束手写奥里亚文字符识别的新型稀疏概念编码四元格变换(SCTT),利用形状自适应四元格捕捉局部手写变化,并应用稀疏编码提取判别性特征。该方法在MNIST数据集上实现了99.40%的最先进识别准确率,在ISI Kolkata数据集上达到99.38%,优于PCA、SparsePCA、SparseLDA以及传统变换如小波和Stockwell变换。
Feature representation in the form of spatio-spectral decomposition is one of the robust techniques adopted in automatic handwritten character recognition systems. In this regard, we propose a new image representation approach for unconstrained handwritten alphanumeric characters using sparse concept coded Tetrolets. Tetrolets, which does not use fixed dyadic square blocks for spectral decomposition like conventional wavelets, preserve the localized variations in handwritings by adopting tetrominoes those capture the shape geometry. The sparse concept coding of low entropy Tetrolet representation is found to extract the important hidden information (concept) for superior pattern discrimination. Large scale experimentation using ten databases in six different scripts (Bangla, Devanagari, Odia, English, Arabic and Telugu) has been performed. The proposed feature representation along with standard classifiers such as random forest, support vector machine (SVM), nearest neighbor and modified quadratic discriminant function (MQDF) is found to achieve state-of-the-art recognition performance in all the databases, viz. 99.40% (MNIST); 98.72% and 93.24% (IITBBS); 99.38% and 99.22% (ISI Kolkata). The proposed OCR system is shown to perform better than other sparse based techniques such as PCA, SparsePCA and SparseLDA, as well as better than existing transforms (Wavelet, Slantlet and Stockwell).
研究动机与目标
- 为解决无约束手写奥里亚文字符识别中形状与风格高度可变的挑战。
- 通过采用形状自适应四元格而非固定块基变换,改进手写字符识别中的特征表示。
- 通过对接收的低熵四元格系数应用稀疏概念编码,增强模式判别能力。
- 在多种文字和大规模数据库上评估所提方法,以验证其鲁棒性与泛化能力。
- 在无约束手写字符识别中,超越现有稀疏与变换基方法的识别准确率。
提出的方法
- 该方法采用四元格,一种基于四格骨牌的非可分、形状自适应变换,将图像分解为更优捕捉手写几何特征的局部谱分量。
- 四元格用四格骨牌分区替代传统双射小波块,保留手写笔画中的结构变化。
- 提取低熵四元格系数以减少冗余并保留显著特征。
- 对接收的四元格系数应用稀疏概念编码,从压缩表示中提取高层判别性特征(概念)。
- 最终特征向量输入标准分类器(如SVM、随机森林、k-NN和MQDF)进行识别。
- 该方法在涵盖六种文字(奥里亚文、孟加拉文、梵文、英文、阿拉伯文和泰卢固文)的十个数据库上进行了评估。
实验结果
研究问题
- RQ1与固定块基变换相比,形状自适应四元格变换是否能改善无约束手写字符识别的特征表示?
- RQ2对四元格系数应用稀疏概念编码是否能增强字符识别的判别能力?
- RQ3所提出的SCTT方法与PCA、SparsePCA、SparseLDA、小波和Stockwell变换等既定稀疏与变换基技术相比表现如何?
- RQ4所提方法是否能在多种文字和无约束手写变化中实现泛化?
- RQ5在多个基准数据库上,所提特征表示可实现的识别准确率水平如何?
主要发现
- 所提出的稀疏概念编码四元格变换在MNIST数据集上实现了99.40%的识别准确率,优于现有最先进方法。
- 在IITBBS数据库上,该方法对奥里亚文字符和孟加拉文字符分别实现了98.72%和93.24%的准确率,表明在低资源文字上表现强劲。
- 在ISI Kolkata数据库上,该方法对奥里亚文字符和梵文字符分别达到99.38%和99.22%的准确率,显示出高度鲁棒性。
- 在所有测试数据库中,该方法始终优于PCA、SparsePCA和SparseLDA,验证了四元格基特征表示的有效性。
- SCTT方法在识别准确率上也优于传统变换如小波、斜向小波和Stockwell变换,尤其在处理无约束手写时表现更优。
- 在六种文字上的大规模实验证实了该方法的泛化能力及其在多样化书写系统中的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。