Skip to main content
QUICK REVIEW

[论文解读] A BLSTM Network for Printed Bengali OCR System with High Accuracy

Debabrata Paul, B.B. Chaudhuri|arXiv (Cornell University)|Aug 23, 2019
Handwritten Text Recognition Techniques参考文献 23被引用 5
一句话总结

本论文提出一种单层BLSTM-CTC神经网络,用于印刷体孟加拉语和英文文本识别,在20种孟加拉语字体上实现了99.32%的字符级准确率和96.65%的词级准确率。该系统无需分词即可处理整行文本,通过CTC实现端到端训练,使用47,720行数据进行训练,其准确率优于谷歌的基于驱动的OCR系统,且有效避免了跨脚本混淆,尤其在阿萨姆语字符识别方面表现优异。

ABSTRACT

This paper presents a printed Bengali and English text OCR system developed by us using a single hidden BLSTM-CTC architecture having 128 units. Here, we did not use any peephole connection and dropout in the BLSTM, which helped us in getting better accuracy. This architecture was trained by 47,720 text lines that include English words also. When tested over 20 different Bengali fonts, it has produced character level accuracy of 99.32% and word level accuracy of 96.65%. A good Indic multi script OCR system is also developed by Google. It sometimes recognizes a character of Bengali into the same character of a non-Bengali script, especially Assamese, which has no distinction from Bengali, except for a few characters. For example, Bengali character for 'RA' is sometimes recognized as that of Assamese, mainly in conjunct consonant forms. Our OCR is free from such errors. This OCR system is available online at https://banglaocr.nltr.org

研究动机与目标

  • 开发一种高精度、端到端的印刷体孟加拉语和英文OCR系统,避免传统OCR流水线中常见的分词错误。
  • 解决现有系统(如Tesseract和谷歌基于驱动的OCR)的局限性,特别是其因视觉相似性而将孟加拉语字符误分类为阿萨姆语字符的问题。
  • 创建一个独立、可访问的OCR系统,可在不依赖云API的情况下部署于各类应用中。
  • 评估在相对较小的47,720行训练数据集上,浅层BLSTM-CTC架构的性能表现。
  • 提升对字体变化和文档退化在孟加拉语书写系统识别中的鲁棒性。

提出的方法

  • 使用具有128个隐藏单元的单层双向长短期记忆(BLSTM)网络进行序列建模,处理每行1×48像素的灰度图像条带。
  • 将BLSTM与联结主义时间分类(CTC)层结合,实现无需显式词或字符对齐的端到端训练。
  • 输入特征被归一化为48像素高,模型以一个批次大小在最多80个周期内进行训练。
  • 当连续两个周期之间的CTC损失变化≤0.01且验证误差变化≤0.1时,训练停止。
  • 使用最小编辑距离(MED)计算保留测试集上的字符级和词级准确率。
  • 系统与Tesseract 4.0和谷歌驱动版OCR(GDS)进行对比测试,结果基于MED准确率指标进行比较。

实验结果

研究问题

  • RQ1单层BLSTM-CTC架构是否能在无需词或字符分词的情况下实现高精度的印刷体孟加拉语和英文文本识别?
  • RQ2轻量级BLSTM-CTC模型在孟加拉语脚本上的性能与谷歌基于驱动的OCR和Tesseract 4.0等最先进系统相比如何?
  • RQ3所提出的系统在多大程度上避免了将孟加拉语字符(尤其是连体形式)误识别为阿萨姆语字符?
  • RQ4BLSTM架构中缺乏窥探连接(peephole connections)和dropout是否有助于在有限训练集上提升泛化能力和准确率?
  • RQ5独立的、开源的OCR系统是否能在保持本地应用可部署性的同时,实现高于云服务系统的准确率?

主要发现

  • 所提出的BLSTM-CTC系统在20种不同孟加拉语字体上实现了99.32%的字符级准确率和96.65%的词级准确率,优于Tesseract 4.0(91.79% CA,76.31% WA)和谷歌基于驱动的OCR(98.54% CA,92.86% WA)。
  • 该系统完全避免了跨脚本混淆,尤其有效防止了将孟加拉语的'RA'误识别为阿萨姆语字符,这是谷歌OCR系统中已知的问题。
  • 使用128个隐藏单元和48个训练周期的模型达到了最低的验证误差,表明其在给定数据集大小下的最优性能。
  • 尽管仅使用47,720条训练样本,系统仍实现了高准确率,表明BLSTM-CTC架构在中等规模数据集上也极为有效。
  • 系统未生成虚假的Dandas(句号分隔符),这是谷歌OCR输出中观察到的问题。
  • 该系统已完全运行并公开发布于 https://banglaocr.nltr.org,支持独立部署并可集成到更大规模应用中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。