Skip to main content
QUICK REVIEW

[论文解读] A Fast Hierarchical Method for Multi-script and Arbitrary Oriented Scene Text Extraction

Lluís Gómez, Dìmosthenis Karatzas|arXiv (Cornell University)|Jul 28, 2014
Handwritten Text Recognition Techniques被引用 9
一句话总结

本文提出了一种快速的分层方法,用于多文种和任意方向场景文本的提取,通过在学习到的特征空间中利用文本固有的结构层次进行凝聚聚类。该方法引入了用于高召回率分组的最优特征空间、一种结合判别分类与知觉组织原理的新型停止规则,以及可逐步计算的组描述符,在四个不同数据集上仅使用单一混合训练集即实现了最先进性能。

ABSTRACT

Typography and layout lead to the hierarchical organisation of text in words, text lines, paragraphs. This inherent structure is a key property of text in any script and language, which has nonetheless been minimally leveraged by existing text detection methods. This paper addresses the problem of text segmentation in natural scenes from a hierarchical perspective. Contrary to existing methods, we make explicit use of text structure, aiming directly to the detection of region groupings corresponding to text within a hierarchy produced by an agglomerative similarity clustering process over individual regions. We propose an optimal way to construct such an hierarchy introducing a feature space designed to produce text group hypotheses with high recall and a novel stopping rule combining a discriminative classifier and a probabilistic measure of group meaningfulness based in perceptual organization. Results obtained over four standard datasets, covering text in variable orientations and different languages, demonstrate that our algorithm, while being trained in a single mixed dataset, outperforms state of the art methods in unconstrained scenarios.

研究动机与目标

  • 解决现有场景文本检测方法将文本检测视为孤立区域分类而非结构化分组的局限性。
  • 通过直接检测结构化分组而非对单个区域进行后处理,利用文本的分层组织结构——词、行、段落。
  • 开发一种统一的、通用的方法,能够在无需任务特定微调的情况下处理多文种和任意方向的文本。
  • 通过将文本建模为连贯的结构单元,提升在非约束场景下的检测召回率和鲁棒性。

提出的方法

  • 该方法在为最大化跨文种和方向的文本组件间相似性而设计的学习特征空间中,使用凝聚的单链聚类。
  • 提出一种新颖的判别性停止规则,结合分类器与基于知觉组织原理的组有意义性概率度量。
  • 使用可逐步计算的组描述符,以高效评估聚类过程中的组假设,同时保持低时间复杂度。
  • 对特征空间进行优化,以编码组件间相似性(如对齐、间距、笔画宽度、对比度),实现高召回率的分组。
  • 算法通过单次遍历完成分层分组,避免了先前方法中常见的启发式后处理步骤。
  • 通过覆盖多种文种和方向的混合训练数据集,实现对多样化场景文本场景的泛化能力。

实验结果

研究问题

  • RQ1是否一种显式建模文本结构的分层聚类方法,能在多文种和任意方向文本场景中超越传统的基于区域的检测方法?
  • RQ2如何学习一个统一的特征空间,以支持无论文种或方向如何,对文本组件实现高召回率的分组?
  • RQ3一个单一的混合训练模型在无需任务特定适配的情况下,能在多大程度上泛化到多样化的场景文本数据集?
  • RQ4结合判别性与概率性标准的停止规则,是否能提升分层文本分组中的检测准确率与效率?
  • RQ5可逐步计算的组描述符的使用,对聚类过程的可扩展性与性能有何影响?

主要发现

  • 在多文种和任意方向文本的MSRRC、MSRA-TD500和KAIST数据集上,所提方法实现了最先进性能,F值分别为0.78、0.74和0.73。
  • 在ICDAR Robust Reading Competition 2013数据集上,该方法取得了0.73的F值,优于大多数专为水平英文文本训练的方法。
  • 在ICDAR2003数据集上,该方法达到了0.69的F值,表明即使在更受约束的评估设置下也表现出色。
  • 该方法仅使用单一混合训练集,即在所有数据集上保持了具有竞争力的性能,证明了其在多样文种和方向上的泛化能力。
  • 基线分析表明,特征空间的多样化可显著提升系统召回率,表明仍有进一步改进空间。
  • 在非水平、多文种场景中,该方法优于专门模型如TextSpotter和USTB TextStar,证实了其鲁棒性与通用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。