[论文解读] AlexU-Word: A New Dataset for Isolated-Word Closed-Vocabulary Offline Arabic Handwriting Recognition
本论文介绍了 AlexU-Word,这是一个新的离线阿拉伯手写识别数据集,包含 25,114 个样本,涵盖 109 个孤立阿拉伯单词,旨在覆盖阿拉伯字母的所有字母形状。该数据集通过在分割的字母图像上训练模型,支持基于字符的识别,利用 SIFT 描述符和人工神经网络(ANN)实现了最先进的 92.16% 的单词识别准确率。
In this paper, we introduce the first phase of a new dataset for offline Arabic handwriting recognition. The aim is to collect a very large dataset of isolated Arabic words that covers all letters of the alphabet in all possible shapes using a small number of simple words. The end goal is to collect a very large dataset of segmented letter images, which can be used to build and evaluate Arabic handwriting recognition systems that are based on segmented letter recognition. The current version of the dataset contains $25114$ samples of $109$ unique Arabic words that cover all possible shapes of all alphabet letters. The samples were collected from $907$ writers. In its current form, the dataset can be used for the problem of closed-vocabulary word recognition. We evaluated a number of window-based descriptors and classifiers on this task and obtained an accuracy of $92.16\%$ using a SIFT-based descriptor and ANN.
研究动机与目标
- 创建一个大规模、封闭词汇的孤立词离线阿拉伯手写识别数据集,全面覆盖阿拉伯字母所有可能的字母形状。
- 通过支持将单词分割为单个字母,促进基于字符的识别系统开发,以训练鲁棒的字符检测器。
- 提供一个基准数据集,以促进在阿拉伯手写识别背景下对全局特征描述符和分类器的评估。
- 未来通过增加更多单词和标注的字符级分割,扩展数据集以提升模型泛化能力。
- 通过利用大规模、多样化的分割字符数据集,推动阿拉伯手写识别范式从单词级检测向字符级检测转变。
提出的方法
- 从 907 名书写者(662 名男性,245 名女性;846 名右撇子,61 名左撇子)收集数据,以确保书写风格和手写差异的多样性。
- 选取了 109 个独特的阿拉伯单词,以确保阿拉伯字母的 28 个字母在四种可能形状(词首、词中、词尾、孤立)中的完整覆盖。
- 每个单词由不同书写者多次书写,共生成 25,114 个样本,数据集按训练集(15,039 个)、验证集(5,048 个)和测试集(5,027 个)进行划分。
- 从单词图像中提取全局图像描述符——方向梯度直方图(HOG7)和尺度不变特征变换(SIFT7)用于分类。
- 评估了三种分类器:k-最近邻(k-NN)、具有一个包含 250 个 Sigmoid 激活神经元的隐藏层的人工神经网络(ANN),以及使用线性核的支持向量机(SVM)。
- 模型训练通过在验证集上进行超参数调优完成,最佳参数在测试集上进行最终评估前选定,ANN 使用 400 次训练迭代。
实验结果
研究问题
- RQ1一组少量简单且高覆盖率的阿拉伯单词是否能有效代表离线手写识别数据集中阿拉伯字母的所有可能形状?
- RQ2在封闭词汇设置下,不同全局图像描述符(HOG7 与 SIFT7)在分类孤立阿拉伯单词时的表现如何?
- RQ3当使用优化后的超参数时,k-NN、SVM 和 ANN 分类器在 AlexU-Word 数据集上的相对性能如何?
- RQ4一个支持将单词分割为单个字母的数据集,能在多大程度上实现基于字符的识别范式?
- RQ5在多样化、书写者多样的孤立阿拉伯单词数据集上,使用 SIFT 特征和 ANN 能达到多高的单词识别准确率?
主要发现
- 当与人工神经网络(ANN)结合时,SIFT7 描述符实现了最高的分类准确率 92.16%,优于 HOG7 及其他分类器组合。
- k-NN 分类器在使用 SIFT7 时达到 79.73% 的准确率,显著高于其在 HOG7 上的 67.45%,表明 SIFT 具有更强的判别能力。
- ANN 分类器在 HOG7 上达到 86.67% 的准确率,在 SIFT7 上达到 92.16%,表明非线性模型更能从更丰富的特征表示中受益。
- SVM 分类器在 SIFT7 上达到 91.16% 的准确率,略低于 ANN,但仍优于所有其他组合,表明线性核具有强大的泛化能力。
- 九个单词类别被 100% 准确分类,混淆矩阵显示出明显的主对角线模式,表明大多数类别之间具有高度可分性。
- 最易混淆的单词对被识别为在视觉上或语音上相似,例如具有相似字母形状或极小正字法差异的单词,证实了模型对细微差异的敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。