Skip to main content
QUICK REVIEW

[论文解读] Benchmarking recognition results on word image datasets

Deepak Kumar, Mohit Prasad|arXiv (Cornell University)|Aug 30, 2012
Handwritten Text Recognition Techniques参考文献 14被引用 5
一句话总结

本论文通过像素级分割和商业OCR(Nuance Omnipage)提出了一项用于文字图像识别的基准测试,识别率分别为83.9%(ICDAR 2003)、89.3%(Sign evaluation)、79.6%(Street View)、88.5%(Born-digital)和86.7%(ICDAR 2011)。作者开发了一款基于GUI的MATLAB工具,对五个不同数据集中的3,606张文字图像进行了人工像素级标注,结果表明,精确的分割可显著提升OCR性能,尤其在倾斜、弯曲或退化文字图像中效果更明显。

ABSTRACT

We have benchmarked the maximum obtainable recognition accuracy on various word image datasets using manual segmentation and a currently available commercial OCR. We have developed a Matlab program, with graphical user interface, for semi-automated pixel level segmentation of word images. We discuss the advantages of pixel level annotation. We have covered five databases adding up to over 3600 word images. These word images have been cropped from camera captured scene, born-digital and street view images. We recognize the segmented word image using the trial version of Nuance Omnipage OCR. We also discuss, how the degradations introduced during acquisition or inaccuracies introduced during creation of word images affect the recognition of the word present in the image. Word images for different kinds of degradations and correction for slant and curvy nature of words are also discussed. The word recognition rates obtained on ICDAR 2003, Sign evaluation, Street view, Born-digital and ICDAR 2011 datasets are 83.9%, 89.3%, 79.6%, 88.5% and 86.7% respectively.

研究动机与目标

  • 通过人工像素级分割和商业OCR,建立可靠的文字图像识别基准。
  • 通过引入细粒度的像素级标注,解决边界框标注的局限性,以提升OCR识别准确率。
  • 评估图像退化(如模糊、倾斜、弯曲和低分辨率)对识别性能的影响。
  • 提供公开可获取的高质量人工标注文字图像数据集,用于分割和识别模型的训练与测试。
  • 证明分割质量是实现高识别准确率的关键因素,尤其在真实世界复杂图像中更为显著。

提出的方法

  • 开发了一款基于MATLAB的图形用户界面(GUI),实现半自动化的文字图像像素级分割。
  • 在五个数据集中人工标注了3,606张文字图像:ICDAR 2003、Sign evaluation、Street View、Born-digital和ICDAR 2011。
  • 使用Nuance Omnipage Professional 16 OCR的试用版,对分割并二值化后的文字图像进行字符识别。
  • 通过归一化编辑距离度量方法,公平比较不同数据集间的识别性能。
  • 采用编辑距离和词级准确率评估识别率,结果按数据集分别报告。
  • 通过人工分割和预处理,处理了运动模糊、倾斜、弯曲和低分辨率等退化问题。

实验结果

研究问题

  • RQ1当使用商业OCR对像素级分割的文字图像进行识别时,可达到的识别准确率是多少?
  • RQ2各种图像退化(如模糊、倾斜、弯曲和低分辨率)如何影响文字图像的OCR性能?
  • RQ3与基于边界框的方法相比,像素级分割在多大程度上提升了识别准确率?
  • RQ4人工标注的像素级数据集能否作为评估文字识别系统的可靠基准?
  • RQ5不同类型的文字图像数据集(如场景图像、数码生成图像、街景图像)之间的识别性能有何差异?

主要发现

  • 在Sign evaluation数据集中达到了最高的89.3%识别率,表明在清晰、结构良好的文本上表现优异。
  • ICDAR 2011数据集的识别率为86.7%,显示由于数据集的优化改进,识别性能优于早期基准。
  • Street View数据集的识别率为79.6%,凸显了真实世界图像中弯曲、倾斜和模糊带来的挑战。
  • Born-digital数据集的识别率达到88.5%,反映出其图像质量更高,退化程度更低,优于相机拍摄的场景图像。
  • ICDAR 2003数据集的识别率为83.9%,表明即使存在退化,通过恰当的分割方法仍可实现高准确率。
  • 本研究证实,分割质量是OCR成功的关键决定因素,人工像素级标注相比自动化或边界框方法可显著提升识别效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。