[论文解读] Handwritten Amharic Character Recognition Using a Convolutional Neural Network
本文提出首个基于卷积神经网络(CNN)的阿姆哈拉文手写字符识别方法,通过多任务学习联合预测阿姆哈拉文中的字符标签、行位置和列位置,以提升准确率。该模型在字符识别任务上达到54.92%的测试准确率,辅助任务(尤其是列预测)显著提升了性能,为未来实现单词级识别及扩展至其他文字系统奠定了基础。
Amharic is the official language of the Federal Democratic Republic of Ethiopia. There are lots of historic Amharic and Ethiopic handwritten documents addressing various relevant issues including governance, science, religious, social rules, cultures and art works which are very rich indigenous knowledge. The Amharic language has its own alphabet derived from Ge’ez which is currently the liturgical language in Ethiopia. Handwritten character recognition for non Latin scripts like Amharic is not addressed especially using the advantages of state-of-the-art techniques. This research work designs for the first time a model for Amharic handwritten character recognition using a convolutional neural network. The dataset was organized from collected sample handwritten documents and data augmentation was applied for machine learning.
研究动机与目标
- 为丰富但尚未充分研究的阿姆哈拉文书写系统,解决缺乏基于深度学习的手写字符识别系统的问题。
- 克服因字符集庞大(265个字符)、视觉相似性高以及训练数据集有限带来的识别挑战。
- 探索利用阿姆哈拉字母中行与列的结构关系进行多任务学习,以增强模型泛化能力。
- 为未来实现阿姆哈拉文单词预测及可扩展的多文字系统识别提供支持。
提出的方法
- 在原始图像像素上直接训练深度卷积神经网络(CNN),无需手工特征提取。
- 应用数据增强技术以增加手写样本的多样性,提升对书写风格差异的鲁棒性。
- 通过同时预测每个字符在阿姆哈拉文中的字符标签、行索引和列索引,引入多任务学习机制。
- 损失函数结合主任务(字符分类)与辅助任务(行与列预测),使用加权系数α以平衡各部分贡献。
- 使用从手写文档中收集的自定义数据集进行模型训练与验证,并对超参数进行调优以实现最优收敛。
- 网络架构利用阿姆哈拉字母的结构布局特性:同一列中的字符共享基础形态,从而通过辅助任务引入归纳偏置。
实验结果
研究问题
- RQ1在不进行人工特征工程的前提下,深度CNN能否在手写阿姆哈拉文字符识别任务中取得具有竞争力的性能?
- RQ2利用行与列位置信息进行多任务学习,如何提升阿姆哈拉文字符的识别准确率?
- RQ3预测行位置与列位置对主分类任务的相对贡献分别如何?
- RQ4能否通过利用阿姆哈拉文中的结构关系来增强模型泛化能力并减少过拟合?
- RQ5该方法在多大程度上可扩展以支持阿姆哈拉文单词预测及多文字系统识别?
主要发现
- 在未使用多任务学习的情况下,CNN模型在字符识别任务上的测试准确率为52.15%,训练准确率高达87.48%,表明由于唯一字符多样性有限,存在严重过拟合现象。
- 多任务学习显著提升了模型泛化能力,所有测试的α值下,训练损失从6.10降至0.58,验证损失从5.74降至1.83。
- 最佳配置采用α₁=1,α₂=0.35,α₃=0.65(分别对应标签、行、列),实现最快收敛与最高测试准确率。
- 模型在测试集上的字符标签预测准确率为54.92%,行预测准确率为68.09%,列预测准确率为65.26%,表明辅助任务性能优异。
- 列预测的学习速度与准确率均高于行预测,可能是因为同一列中的字符具有结构相似性,共享基础形态。
- 结果表明,通过多任务学习利用阿姆哈拉文固有的布局结构,可有效提升识别性能,并为单词级预测与多文字系统可扩展性开辟新路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。