Skip to main content
QUICK REVIEW

[论文解读] Text Perceptron: Towards End-to-End Arbitrary-Shaped Text Spotting

Qiao Liang, Sanli Tang|arXiv (Cornell University)|Feb 17, 2020
Handwritten Text Recognition Techniques参考文献 40被引用 4
一句话总结

Text Perceptron 提出了一种端到端可训练的框架,用于任意形状文本检测与识别,通过将基于分割的检测器与可微分的形状变换模块(STM)相结合,后者能动态优化薄板样条(TPS)校正所用的控制点。该方法在 Total-Text 和 CTW1500 等不规则文本基准上实现了最先进性能,显著优于以往的流水线式或非端到端方法,通过反向传播的误差信号实现了检测与识别的联合优化。

ABSTRACT

Many approaches have recently been proposed to detect irregular scene text and achieved promising results. However, their localization results may not well satisfy the following text recognition part mainly because of two reasons: 1) recognizing arbitrary shaped text is still a challenging task, and 2) prevalent non-trainable pipeline strategies between text detection and text recognition will lead to suboptimal performances. To handle this incompatibility problem, in this paper we propose an end-to-end trainable text spotting approach named Text Perceptron. Concretely, Text Perceptron first employs an efficient segmentation-based text detector that learns the latent text reading order and boundary information. Then a novel Shape Transform Module (abbr. STM) is designed to transform the detected feature regions into regular morphologies without extra parameters. It unites text detection and the following recognition part into a whole framework, and helps the whole network achieve global optimization. Experiments show that our method achieves competitive performance on two standard text benchmarks, i.e., ICDAR 2013 and ICDAR 2015, and also obviously outperforms existing methods on irregular text benchmarks SCUT-CTW1500 and Total-Text.

研究动机与目标

  • 为解决传统流水线式文本检测与识别之间的不兼容性,该问题限制了在不规则文本上的端到端优化与鲁棒性。
  • 克服固定校正方法与非可微控制点生成在处理弯曲或多方向场景文本时的局限性。
  • 设计一种统一的可训练框架,通过基于识别反馈动态调整控制点,联合优化文本检测与识别。
  • 通过基于分割的检测器显式建模阅读顺序与边界结构,提升对任意形状文本的识别准确率。
  • 通过将校正嵌入端到端训练过程,消除对外部校正网络的需求,并降低计算成本。

提出的方法

  • 设计基于分割的文本检测器,将每个像素分类为四类:中心、头部、尾部以及顶部/底部边界,从而实现对具有学习到的阅读顺序的文本实例的检测。
  • 形状变换模块(STM)利用可微分的薄板样条(TPS)生成并优化文本边界上的控制点,将不规则文本转换为规则的校正形式。
  • 通过识别头的反向传播动态调整控制点,实现检测与识别组件的端到端优化。
  • 框架使用基于序列的识别头(如 CRNN)从校正后的特征中生成字符序列。
  • 整个系统采用端到端训练,使识别中的误差信号能够反向优化检测与控制点位置。
  • 该方法支持可变数量的控制点(4 至 18 个),在不规则基准上性能在 10–14 个点时趋于稳定。

实验结果

研究问题

  • RQ1可微分的端到端框架能否联合优化任意形状文本的检测与识别,从而克服流水线方法的局限性?
  • RQ2控制点数量如何影响在弯曲和多方向文本上校正与识别的性能?
  • RQ3具有结构化边界分类的基于分割的检测器能否提升对紧密排列或重叠文本实例的检测能力?
  • RQ4具有可学习控制点的可微分形状变换模块在性能上能否超越非可微或固定几何结构的校正方法?
  • RQ5通过反向传播识别误差进行端到端训练,是否能比传统两阶段训练带来更好的检测与校正效果?

主要发现

  • 在 ICDAR 2015 上使用 18 个控制点时,Text Perceptron 的检测 F-score 达到 87.1,在 Total-Text 上达到 85.3,表明其在规则与不规则文本上均具有强大泛化能力。
  • 在不规则基准 CTW1500 上,该方法使用 18 个控制点时实现了 84.5 的端到端 F-score,显著优于以往最先进方法。
  • 在 Total-Text 和 CTW1500 上,随着控制点数量增加,性能持续提升,稳定在 10–14 个点之间,表明更复杂的形状需要更高保真度的控制点表示。
  • 使用 4 个控制点时,该方法在 ICDAR 2015 上仍达到 87.1 的 F-score,与更高点数相比性能下降极小,表明其对规则文本已具备足够容量。
  • 失败案例分析显示,重叠文本与垂直文本识别仍具挑战性,主要由于训练数据中表示不足以及识别模型的歧义性。
  • 可视化结果证实,该模型能有效捕捉阅读顺序,并利用学习到的控制点将弯曲、透视及垂直文本准确校正为规则形式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。