Skip to main content
QUICK REVIEW

[论文解读] TextProposals: a Text-specific Selective Search Algorithm for Word Spotting in the Wild

Lluís Gómez, Dìmosthenis Karatzas|arXiv (Cornell University)|Apr 10, 2016
Handwritten Text Recognition Techniques参考文献 57被引用 18
一句话总结

本文提出 TextProposals,一种针对文本的物体候选区域生成算法,通过利用多种相似性线索对连通域进行分层分组,无需假设初始区域对应单个字符,从而生成高质量的单词候选。该方法在端到端单词检测任务中达到最先进性能,在 ICDAR2015 Incidental Text 数据集上结合整体识别器后,F-score 超过此前方法 10% 以上。

ABSTRACT

Motivated by the success of powerful while expensive techniques to recognize words in a holistic way, object proposals techniques emerge as an alternative to the traditional text detectors. In this paper we introduce a novel object proposals method that is specifically designed for text. We rely on a similarity based region grouping algorithm that generates a hierarchy of word hypotheses. Over the nodes of this hierarchy it is possible to apply a holistic word recognition method in an efficient way. Our experiments demonstrate that the presented method is superior in its ability of producing good quality word proposals when compared with class-independent algorithms. We show impressive recall rates with a few thousand proposals in different standard benchmarks, including focused or incidental text datasets, and multi-language scenarios. Moreover, the combination of our object proposals with existing whole-word recognizers shows competitive performance in end-to-end word spotting, and, in some benchmarks, outperforms previously published results. Concretely, in the challenging ICDAR2015 Incidental Text dataset, we overcome in more than 10 percent f-score the best-performing method in the last ICDAR Robust Reading Competition. Source code of the complete end-to-end system is available at https://github.com/lluisgomez/TextProposals

研究动机与目标

  • 解决传统场景文本识别方法依赖单个字符分割的局限性,这些方法在退化、连笔或低对比度文本上常失效。
  • 开发一种无需显式字符分割即可生成高质量单词候选区域的方法,从而实现高效的整体单词识别。
  • 提升端到端单词检测中的召回率与性能,特别是在低质量或小尺寸文本的挑战性非聚焦文本数据集上。
  • 证明文本专用的物体候选区域方法在文本检测与识别任务中优于通用物体候选区域算法。

提出的方法

  • 该方法采用分层聚类策略,基于空间接近度与视觉相似性对连通域进行分组,将所有组件视为潜在的文本组成部分,无论其来源如何。
  • 利用互补线索(如空间、颜色、纹理)构建多个相似性层次,以提高每个单词实例至少在一个层次中被捕捉的可能性。
  • 提出一种新颖的排序策略与非极大值抑制过程,利用层次结构中节点的包含关系,高效筛选出最优候选区域。
  • 该算法不假设固定层次结构(如字符 → 双字词 → 单词),从而在处理连笔或碎片化文本等多样化文本形式时具备灵活性。
  • 最终的单词候选区域被输入整体单词识别器(如 DictNet),实现高效且高精度的端到端单词检测。
  • 该系统设计具备跨多语言场景与多种图像条件(包括低分辨率、模糊、复杂背景)的鲁棒性。

实验结果

研究问题

  • RQ1文本专用的物体候选区域方法是否能在单词检测任务中超越通用物体候选区域算法?
  • RQ2基于多种相似性线索的分层分组策略是否能提升无约束场景下单词候选区域的召回率与质量?
  • RQ3一种避免显式字符分割的方法是否能在具有挑战性的非聚焦文本数据集上实现更优性能?
  • RQ4将文本专用候选区域与整体单词识别器结合,与现有端到端单词检测流程相比表现如何?
  • RQ5该方法在聚焦文本、非聚焦文本及多语言场景中的泛化能力如何?

主要发现

  • 在 ICDAR2015 Incidental Text 数据集上,TextProposals 达到 56.00% 的 F-score,超过此前最佳方法超过 10 个百分点。
  • 在 ICDAR2013 Focused Text 数据集上,该方法在端到端单词检测中达到 70.71% 的 F-score,优于所有先前参赛作品。
  • 仅需数千个候选区域,该方法在多种基准测试中均实现高召回率,涵盖多语言与低质量文本场景。
  • 该方法在非聚焦文本上表现优异,而传统检测器常因文本尺寸小、分辨率低或非水平方向而失效。
  • 将 TextProposals 与 DictNet 整体识别器结合,即使字典仅覆盖 ICDAR2015 测试集中 70% 的单词,仍实现最先进结果。
  • 所提出的排序与抑制策略有效利用了层次结构,实现在不牺牲召回率的前提下高效且准确地选择候选区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。