Skip to main content
QUICK REVIEW

[论文解读] Efficient Scene Text Localization and Recognition with Local Character Refinement

Lukáš Neumann, Jiřı́ Matas|arXiv (Cornell University)|Apr 14, 2015
Handwritten Text Recognition Techniques参考文献 19被引用 4
一句话总结

本文提出了一种端到端的实时场景文本定位与识别方法,通过结合MSER与一种基于笔画支持像素(SSPs)的新笔画区域比特征,可检测任意字符数量或方向的文本片段。通过使用局部分割模型对初始假设进行优化,提升了鲁棒性,在ICDAR 2013数据集上实现了77.6%的SOTA f-measure,平均单图运行时间为800ms。

ABSTRACT

An unconstrained end-to-end text localization and recognition method is presented. The method detects initial text hypothesis in a single pass by an efficient region-based method and subsequently refines the text hypothesis using a more robust local text model, which deviates from the common assumption of region-based methods that all characters are detected as connected components. Additionally, a novel feature based on character stroke area estimation is introduced. The feature is efficiently computed from a region distance map, it is invariant to scaling and rotations and allows to efficiently detect text regions regardless of what portion of text they capture. The method runs in real time and achieves state-of-the-art text localization and recognition results on the ICDAR 2013 Robust Reading dataset.

研究动机与目标

  • 解决基于区域的文本检测方法中假设字符为单一连通区域所带来的局限性,此类方法对噪声和碎片化敏感。
  • 通过检测任意文本片段(单个字符、多字符组合或部分单词)而非依赖严格的连通组件假设,提升文本定位精度。
  • 开发一种对尺度、旋转和噪声具有不变性的鲁棒且可扩展的文本区域检测特征,以实现对部分或碎片化文本的高效检测。
  • 通过结合基于SSPs的GMM色彩模型与迭代局部优化,提升识别性能,改善分割质量。

提出的方法

  • 通过增强新型笔画区域比特征($\varsigma$)的MSER生成初始文本假设,该特征用于估算属于字符笔画的区域像素比例。
  • 笔画区域比特征通过区域距离图高效计算,对尺度和旋转具有不变性,且相比单笔画宽度估计方法更具抗噪鲁棒性。
  • 通过基线估计模型对MSER进行分组形成文本行,随后利用局部分割模型进行迭代优化,将像素分类为前景、背景或忽略区域。
  • 笔画支持像素(SSPs)被识别为字符笔画上的中心点,既用于计算笔画区域比,也用于训练更精确的基于GMM的色彩模型以提升分割质量。
  • 采用基于图的OCR模块,结合二阶语言模型特征,解决歧义并从分割组件中生成最终的词序列。
  • 整个流水线在多尺度下运行,通过在图中选择最低成本路径合并重叠检测结果,确保端到端识别的鲁棒性。

实验结果

研究问题

  • RQ1能否开发一种统一特征,以检测代表单个字符、多字符组合或部分单词的文本区域,而不论其形式如何?
  • RQ2如何通过突破字符必须为单一连通区域的假设,提升基于区域的文本检测的鲁棒性?
  • RQ3基于笔画支持像素的局部分割模型在复杂场景中对文本行优化的提升程度如何,能否有效减少误报?
  • RQ4基于距离图的笔画区域估计特征能否在保持计算高效的同时,实现对尺度和旋转的不变性?
  • RQ5将SSPs整合到色彩模型中,能否提升低对比度或噪声区域的分割精度?

主要发现

  • 该方法在ICDAR 2013鲁棒阅读数据集上实现了77.6%的SOTA f-measure,优于此前所有方法,包括2013年竞赛优胜者。
  • 该方法报告召回率为72.4%,精确率为81.8%,显著优于2013年优胜者的66%召回率和76.2% f-measure。
  • 端到端识别正确地定位并识别了45%的单词(共1189个中的543个),仅有79个幻觉词未与真实标签重叠。
  • 在标准2.7GHz PC上,平均单图运行时间为800ms,证明了其实时可行性。
  • 该方法在检测碎片化或部分可见文本方面尤为有效,因为基于SSP的特征可检测任意字符数量的文本区域。
  • 失败案例主要源于类似字符的物体(如箭头、图标)以及在初始MSER阶段未被捕捉到的低对比度文本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。