Skip to main content
QUICK REVIEW

[论文解读] PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network

Pengfei Wang, Chengquan Zhang|arXiv (Cornell University)|Apr 12, 2021
Handwritten Text Recognition Techniques被引用 5
一句话总结

PGNet 提出了一种实时、单阶段的文本检测与识别框架,用于任意形状的文本,通过引入点汇聚 CTC(PG-CTC)损失和解码器,消除了对字符级标注、非极大值抑制(NMS)和区域建议框(RoI)操作的需求。该方法在 Total-Text 上实现了 46.7 FPS 的推理速度,同时保持了具有竞争力的准确率,其性能通过图优化模块(GRM)进一步提升,该模块通过建模字符序列的上下文关系增强了识别能力。

ABSTRACT

The reading of arbitrarily-shaped text has received increasing research attention. However, existing text spotters are mostly built on two-stage frameworks or character-based methods, which suffer from either Non-Maximum Suppression (NMS), Region-of-Interest (RoI) operations, or character-level annotations. In this paper, to address the above problems, we propose a novel fully convolutional Point Gathering Network (PGNet) for reading arbitrarily-shaped text in real-time. The PGNet is a single-shot text spotter, where the pixel-level character classification map is learned with proposed PG-CTC loss avoiding the usage of character-level annotations. With a PG-CTC decoder, we gather high-level character classification vectors from two-dimensional space and decode them into text symbols without NMS and RoI operations involved, which guarantees high efficiency. Additionally, reasoning the relations between each character and its neighbors, a graph refinement module (GRM) is proposed to optimize the coarse recognition and improve the end-to-end performance. Experiments prove that the proposed method achieves competitive accuracy, meanwhile significantly improving the running speed. In particular, in Total-Text, it runs at 46.7 FPS, surpassing the previous spotters with a large margin.

研究动机与目标

  • 开发一种实时、端到端的文本检测与识别系统,能够处理任意形状的文本,且无需依赖字符级标注。
  • 通过设计单阶段、全卷积神经网络架构,消除 NMS 和 RoI 等计算密集型操作。
  • 提升在非传统阅读方向和复杂文本布局下的识别鲁棒性。
  • 通过图优化模块(GRM)对字符序列进行上下文建模,提升识别准确率。
  • 在公共基准测试中实现高推理速度,同时不牺牲识别性能。

提出的方法

  • 采用全卷积网络(FCN)在多任务学习设置下,同时预测文本中心线(TCL)、边界偏移(TBO)、方向偏移(TDO)和字符分类特征图(TCC)。
  • PG-CTC 损失使像素级字符分类特征图能够实现端到端训练,而无需字符级标注。
  • PG-CTC 解码器通过沿 TCL 和 TDO 定义的阅读顺序收集点,将二维 TCC 特征图序列化为字符概率序列。
  • 利用 TDO 特征图动态恢复阅读顺序,从而实现对非从左到右或非从上到下方向文本的正确识别。
  • 图优化模块(GRM)通过空间图神经网络建模字符间的依赖关系,利用邻近字符的视觉与语义上下文对预测结果进行优化。
  • GRM 基于字符点之间的 L2 距离,使用对称归一化拉普拉斯邻接矩阵来定义节点间的关系。

实验结果

研究问题

  • RQ1单阶段、端到端的文本检测与识别器是否能够在不依赖字符级标注的前提下,仍保持高准确率?
  • RQ2新颖的损失函数与解码机制(PG-CTC)是否能够替代 NMS 和 RoI 操作,且不降低性能?
  • RQ3通过 TDO 实现的动态阅读顺序恢复是否能提升对非传统方向文本的识别效果?
  • RQ4基于图的优化模块是否能通过建模字符间的上下文关系来提升识别性能?
  • RQ5所提出的方法是否能在保持当前最先进准确率的同时,实现实时推理速度?

主要发现

  • PGNet 在 Total-Text 基准测试中实现了 46.7 FPS 的推理速度,显著优于以往最先进方法的推理速度。
  • 该模型在 Total-Text 和 ICDAR2015 上均实现了具有竞争力的识别准确率,表明其在弯曲和不规则文本上具有强大的泛化能力。
  • PG-CTC 损失使模型无需字符级标注即可进行训练,显著降低了数据标注成本,同时保持了良好的性能。
  • TDO 特征图使模型能够正确识别非传统阅读方向的文本,定性结果表明 'MOVE' 被正确识别为 'MOVE' 而非 'EVOM'。
  • GRM 通过纠正缺失、错误或多余字符的识别错误,提升了识别性能,例如在 'PRT' → 'PORT' 和 'NARKET' → 'MARKET' 的案例中表现显著。
  • 定性结果表明,GRM 能够有效实现字符的添加、修改和删除,从而优化预测结果,充分证明了其在端到端识别中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。