[论文解读] Transformer based Urdu Handwritten Text Optical Character Reader
本文提出了一种基于Transformer的乌尔都语手写文本识别架构,利用ResNet-18进行特征提取,并采用自定义的Transformer解码器逐字符预测。尽管由于训练数据有限,字符错误率(CER)超过85%,但该工作首次将Transformer应用于低资源乌尔都语手写OCR,为该尚未充分探索的领域奠定了未来研究的基础。
Extracting Handwritten text is one of the most important components of digitizing information and making it available for large scale setting. Handwriting Optical Character Reader (OCR) is a research problem in computer vision and natural language processing computing, and a lot of work has been done for English, but unfortunately, very little work has been done for low resourced languages such as Urdu. Urdu language script is very difficult because of its cursive nature and change of shape of characters based on it's relative position, therefore, a need arises to propose a model which can understand complex features and generalize it for every kind of handwriting style. In this work, we propose a transformer based Urdu Handwritten text extraction model. As transformers have been very successful in Natural Language Understanding task, we explore them further to understand complex Urdu Handwriting.
研究动机与目标
- 开发一种深度学习模型,以识别乌尔都语手写文本,该语言为低资源语言且具有复杂的连笔书写特征。
- 探索Transformer架构在处理上下文依赖性强、连笔字多的乌尔都语手写文本时的有效性。
- 解决公开可用、大规模乌尔都语手写数据集和商业级连笔乌尔都语OCR解决方案的缺乏问题。
- 为未来基于注意力机制的序列建模在乌尔都语手写识别中的研究建立基线模型。
- 探究在未使用大规模语言数据预训练的情况下,端到端字符级序列预测是否可行。
提出的方法
- 使用在ImageNet上预训练的ResNet-18,从输入的乌尔都语手写图像中提取高维特征。
- 将ResNet-18的输出通过全连接层处理,生成适合Transformer输入的序列嵌入表示。
- 采用具有因果自注意力机制的Transformer解码器,逐个字符预测,以建模序列中的长距离依赖关系。
- 使用掩码语言建模进行模型训练,即在训练过程中对真实标签进行掩码,以预测正确的字符序列。
- 未使用Transformer的预训练权重,从头开始训练模型,以适应乌尔都语手写文本的特定特征。
- 将OCR任务视为序列到序列的分类问题,通过学习的表示将输入图像映射为字符序列。
实验结果
研究问题
- RQ1尽管乌尔都语具有复杂的连笔书写特征且连笔字数量多,基于Transformer的架构是否仍能有效识别手写乌尔都语文本?
- RQ2在低资源设置下,从有限乌尔都语手写数据中从头训练的Transformer模型性能与现有方法相比如何?
- RQ3在字符形状因位置不同而显著变化的乌尔都语手写文本中,Transformer中的自注意力机制在多大程度上能捕捉上下文依赖关系?
- RQ4使用Transformer进行端到端序列建模是否能消除乌尔都语手写识别中对独立语言模型的依赖?
- RQ5在训练数据稀缺的情况下,将Transformer应用于低资源手写识别时面临哪些关键限制?
主要发现
- 模型的字符错误率(CER)超过85%,表明由于训练数据不足,模型收敛和性能均表现不佳。
- 尽管错误率较高,模型仍成功证明了将Transformer架构应用于乌尔都语手写文本识别的可行性。
- 缺乏大规模、多样化的乌尔都语手写数据集严重阻碍了模型的收敛与泛化能力。
- 未在乌尔都语语言数据上进行预训练,直接从头训练Transformer,限制了其学习有意义序列表示的能力。
- 由于采用字符级预测,输出序列长度过长,可能加剧了训练不稳定性并导致性能下降。
- 本工作为未来研究建立了基础框架,特别是在微调预训练语言模型或使用数据增强技术以提升性能方面具有重要意义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。