Skip to main content
QUICK REVIEW

[论文解读] All You Need Is Boundary: Toward Arbitrary-Shaped Text Spotting

Hao Wang, Pu Lu|arXiv (Cornell University)|Nov 21, 2019
Handwritten Text Recognition Techniques参考文献 33被引用 5
一句话总结

本文提出了一种新颖的端到端文本定位框架,将任意形状的文本表示为边界点集合,而非边界框或分割掩码。通过使用基于方向矩形提议的粗到细检测流程,随后进行可微分的边界点回归与校正,该方法在 ICDAR2015、TotalText 和 COCO-Text 上实现了最先进性能,且无需字符级标注。

ABSTRACT

Recently, end-to-end text spotting that aims to detect and recognize text from cluttered images simultaneously has received particularly growing interest in computer vision. Different from the existing approaches that formulate text detection as bounding box extraction or instance segmentation, we localize a set of points on the boundary of each text instance. With the representation of such boundary points, we establish a simple yet effective scheme for end-to-end text spotting, which can read the text of arbitrary shapes. Experiments on three challenging datasets, including ICDAR2015, TotalText and COCO-Text demonstrate that the proposed method consistently surpasses the state-of-the-art in both scene text detection and end-to-end text recognition tasks.

研究动机与目标

  • 为解决矩形边界框在表示不规则形状文本(尤其是弯曲或倾斜文本)时的局限性。
  • 消除端到端文本定位中对昂贵字符级标注的需求。
  • 通过可微分边界点回归精确定位文本边界,提升特征提取与识别准确率。
  • 通过统一且可微分的流程,实现检测与识别之间的有效联合优化。

提出的方法

  • 该方法使用两阶段检测器,首先为文本实例预测方向矩形框。
  • 利用专用的边界点检测网络,从每个方向RoI内的特征中回归边界点。
  • 通过可微分变换将不规则边界点映射到校正后的水平区域,以供序列识别。
  • Arbitrary RoIAlign 层基于预测的边界点对特征进行对齐,实现精确的特征提取。
  • 整个流程端到端可训练,支持反向传播联合优化检测与识别。
  • 采用粗到细策略,通过方向矩形框作为边界点预测的稳定初始化,提升鲁棒性。

实验结果

研究问题

  • RQ1边界点表示是否在检测与识别任意形状文本方面优于矩形边界框?
  • RQ2基于边界点的特征对齐相比标准RoI对齐,如何提升识别性能?
  • RQ3该方法是否能在无需字符级标注的情况下实现最先进性能?
  • RQ4使用方向矩形提议是否显著提升边界点检测的准确率?
  • RQ5该方法在包含弯曲、倾斜和水平文本的多样化基准上是否具备良好的泛化能力?

主要发现

  • 在 ICDAR2015 上,检测的 F-score 达到 89.8%,端到端定位的 F-score 达到 88.6%,超越了先前最先进方法。
  • 在 TotalText 上,检测的 F-score 为 88.9%,端到端 F-score 为 87.0%,展现出在弯曲文本上的强大性能。
  • 在 COCO-Text 上,该方法在检测(F-score 85.8%)和端到端任务(F-score 65.0%)上均达到最先进性能,且未使用 COCO-Text 的训练数据。
  • 与轴对齐提议相比,使用方向矩形提议使 TotalText 上的检测与端到端性能分别提升 1.2% 和 ICDAR2015 上提升 0.8%。
  • 消融实验表明,边界点表示可实现更精确的特征提取与更优的识别效果,尤其在不规则文本上表现更佳。
  • 该方法在未见数据集上泛化良好,能稳健处理垂直、弯曲和长文本实例,但对罕见字体、极小或模糊文本仍存在挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。