[论文解读] Morphological Reconstruction for Word Level Script Identification
本文提出了一种基于形态学重建的方法,用于多语言印度文档中的词级文字识别,利用方向性图像重建和区域描述符来区分卡纳达文、泰卢固文、天城文和阿拉伯数字。在2,625张涵盖多种字体和尺寸的词图像上进行评估,该方法通过最近邻分类实现了高准确率,展示了在多语言OCR预处理中的优异性能。
A line of a bilingual document page may contain text words in regional language and numerals in English. For Optical Character Recognition (OCR) of such a document page, it is necessary to identify different script forms before running an individual OCR system. In this paper, we have identified a tool of morphological opening by reconstruction of an image in different directions and regional descriptors for script identification at word level, based on the observation that every text has a distinct visual appearance. The proposed system is developed for three Indian major bilingual documents, Kannada, Telugu and Devnagari containing English numerals. The nearest neighbour and k-nearest neighbour algorithms are applied to classify new word images. The proposed algorithm is tested on 2625 words with various font styles and sizes. The results obtained are quite encouraging
研究动机与目标
- 解决在包含区域文字和英文数字的双语印度文档中,于词级识别混合文字的挑战。
- 开发一种鲁棒的、基于图像的文本分类方法,对字体变化和尺寸差异具有不变性。
- 评估形态学重建和区域描述符在区分不同文字视觉模式方面的有效性。
- 通过将单个词分类到其对应文字类型,实现多语言OCR系统的准确预处理。
提出的方法
- 在多个方向(水平、垂直、对角线)应用形态学开运算重建,从词图像中提取方向性结构特征。
- 使用从重建图像中导出的区域描述符,表示每个词的局部纹理和形状特征。
- 采用最近邻(NN)和k-最近邻(k-NN)分类算法,基于特征相似性分配文字标签。
- 通过二值化和归一化对输入图像进行预处理,以确保形态学运算的一致性输入。
- 在包含2,625张来自卡纳达文、泰卢固文、天城文和英文数字的词图像数据集上训练和测试分类器,涵盖多种字体样式和尺寸。
- 利用方向性重建突出不同文字之间的结构差异,如笔画密度和方向模式。
实验结果
研究问题
- RQ1在多个方向上的形态学重建是否能有效捕捉用于词级文字识别的判别性特征?
- RQ2从重建图像中导出的区域描述符在多种字体样式和尺寸下是否能提升文字分类准确率?
- RQ3k-NN分类器在区分印度区域文字和阿拉伯数字方面,相较于最近邻方法的优越程度如何?
- RQ4所提出的方法在真实世界多语言文档图像中对字体和尺寸变化是否具有鲁棒性?
主要发现
- 所提方法在来自三种主要印度文字和英文数字的2,625张词图像上实现了高分类准确率,表现出对字体和尺寸变化的强鲁棒性。
- 在多个方向上的形态学重建有效提取了能区分不同文字视觉外观的方向性结构特征。
- k-NN分类器在分类准确率方面优于最近邻分类器,表明考虑多个相似训练样本具有优势。
- 从重建图像中导出的区域描述符在捕捉每种文字特有的局部纹理和形状模式方面表现有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。