Skip to main content
QUICK REVIEW

[论文解读] Tamizhi-Net OCR: Creating A Quality Large Scale Tamil-Sinhala-English Parallel Corpus Using Deep Learning Based Printed Character Recognition (PCR).

Charangan Vasantharajan, Uthayasanker Thayasivam|arXiv (Cornell University)|Sep 13, 2021
Handwritten Text Recognition Techniques参考文献 9被引用 4
一句话总结

该论文提出了一种基于深度学习增强的Tesseract 4.1.1模型——Tamizhi-Net OCR,通过在传统字体上使用LSTM进行训练,以提升泰米尔语、僧伽罗语和英语的印刷体字符识别(PCR)性能。该模型在泰米尔语上实现了98.2%的字符级准确率(相对提升12.9%),在僧伽罗语上实现了94.8%的字符级准确率(相对提升3.26%),实现了对非标准字体PDF中多语言文本的可扩展、自动提取。

ABSTRACT

Most of the low resource languages do not have the necessary resources to create even a substantial monolingual corpus. These languages may often be found in government proceedings but mostly in the form of Portable Document Formats (PDFs) that contains legacy fonts. Extracting text from these documents to create a monolingual corpus is challenging due to legacy font usage and printer-friendly encoding which are not optimized for text extraction. Therefore, we propose a simple, automatic, and novel idea that can scale for Tamil, Sinhala, and English languages and many documents. For this purpose, we enhanced the performance of Tesseract 4.1.1 by employing LSTM-based training on many legacy fonts to recognize printed characters in the above languages. Especially, our model detects code-mix text, numbers, and special characters from the printed document. It is shown that this approach can boost the character-level accuracy of Tesseract 4.1.1 from 85.5 to 98.2 for Tamil (+12.9% relative change) and 91.8 to 94.8 for Sinhala (+3.26% relative change) on a dataset that is considered as challenging by its authors.

研究动机与目标

  • 解决泰米尔语和僧伽罗语等低资源语言缺乏大规模、高质量单语语料库的问题。
  • 克服从使用传统字体和打印机友好编码的PDF中提取文本的挑战。
  • 开发一种自动、可扩展的方法,用于识别混合语言(代码混合)文档中的泰米尔语、僧伽罗语和英语印刷体字符。
  • 通过在传统字体数据上应用深度学习,提升Tesseract 4.1.1在这些语言上的字符级准确率。
  • 实现从扫描的、使用传统字体的PDF中自动创建泰米尔语-僧伽罗语-英语平行语料库。

提出的方法

  • 在多样化传统字体上训练基于LSTM的光学字符识别(OCR)模型,以增强Tesseract 4.1.1。
  • 在包含印刷体泰米尔语、僧伽罗语和英语字符的大型多语言数据集上训练模型,该数据集涵盖代码混合文本、数字和特殊字符。
  • 应用迁移学习技术,将Tesseract现有架构适配以识别具有复杂字符集的非拉丁脚本。
  • 优化模型以处理政府文档中常见的打印机友好编码和非标准字体映射。
  • 使用自定义数据流水线,将传统字体PDF预处理并增强为训练样本,以提升泛化能力。
  • 通过一个具有挑战性的基准数据集评估性能,以衡量字符级准确率的提升。

实验结果

研究问题

  • RQ1LSTM增强的Tesseract 4.1.1是否能显著提升在使用传统字体的文档中泰米尔语和僧伽罗语的字符级准确率?
  • RQ2该模型在多语言印刷文档中,对代码混合文本、数字和特殊字符的检测与正确识别能力如何?
  • RQ3该方法在处理低资源语言的政府和档案文档大规模数据时,其可扩展性如何?
  • RQ4与基线Tesseract 4.1.1相比,该方法在传统字体PDF上对泰米尔语和僧伽罗语的OCR准确率相对提升了多少?
  • RQ5该方法是否能实现从扫描文档中自动创建高质量的泰米尔语-僧伽罗语-英语平行语料库?

主要发现

  • 所提出的Tamizhi-Net OCR模型在具有挑战性的基准数据集上,将泰米尔语的字符级准确率从85.5%提升至98.2%,相对提升12.9%。
  • 对于僧伽罗语,该模型实现了94.8%的字符级准确率,相较于基线Tesseract 4.1.1的91.8%,相对提升3.26%。
  • 该模型在多语言印刷文档中,对代码混合文本、数字和特殊字符的识别具有高保真度。
  • 该方法在处理政府和档案库中常见的大规模传统字体PDF方面表现出良好的可扩展性。
  • 增强后的Tesseract模型能够从扫描的、非标准文档格式中自动创建高质量的单语和并行语料库。
  • 结果证实,在传统字体上进行基于LSTM的微调,能显著提升泰米尔语和僧伽罗语等低资源文字的OCR性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。