Skip to main content
QUICK REVIEW

[论文解读] Scene Text Detection with Supervised Pyramid Context Network

Enze Xie, Yuhang Zang|arXiv (Cornell University)|Nov 21, 2018
Handwritten Text Recognition Techniques参考文献 26被引用 22
一句话总结

该论文提出了一种监督式金字塔上下文网络(SPCNET),用于场景文本检测,通过整合语义分割引导和重评分机制来提升准确率并抑制误检。SPCNET基于特征金字塔网络(FPN)和Mask R-CNN框架,利用全局上下文信息与优化后的分类分数,在多种基准测试中实现最先进性能,包括在ICDAR2013上达到92.1%的F1值,在Total-Text上达到82.9%。

ABSTRACT

Scene text detection methods based on deep learning have achieved remarkable results over the past years. However, due to the high diversity and complexity of natural scenes, previous state-of-the-art text detection methods may still produce a considerable amount of false positives, when applied to images captured in real-world environments. To tackle this issue, mainly inspired by Mask R-CNN, we propose in this paper an effective model for scene text detection, which is based on Feature Pyramid Network (FPN) and instance segmentation. We propose a supervised pyramid context network (SPCNET) to precisely locate text regions while suppressing false positives. Benefited from the guidance of semantic information and sharing FPN, SPCNET obtains significantly enhanced performance while introducing marginal extra computation. Experiments on standard datasets demonstrate that our SPCNET clearly outperforms start-of-the-art methods. Specifically, it achieves an F-measure of 92.1% on ICDAR2013, 87.2% on ICDAR2015, 74.1% on ICDAR2017 MLT and 82.9% on Total-Text.

研究动机与目标

  • 解决真实场景中文本检测中持续存在的高误检率问题,尤其是在复杂视觉条件下。
  • 提升对多方向、多语言及弯曲文本实例的检测鲁棒性,这些情况是现有方法的难点。
  • 通过引入全局语义上下文并利用重评分机制优化分类分数,降低误检率。
  • 通过在检测与分割分支之间共享特征,保持高效率,最小化额外计算开销。

提出的方法

  • 提出一种监督式金字塔上下文网络(SPCNET),在基于FPN的Mask R-CNN基础上扩展出语义分割分支,为更好区分目标提供全局上下文信息。
  • 引入文本上下文模块,通过将分割分支中的全局语义线索融合到检测分支,增强特征表示能力。
  • 设计重评分机制,将分类分数与分割分支的激活响应相结合,生成融合分数,提升倾斜或低分文本实例的置信度。
  • 利用分割掩码输出,实现对任意形状文本(包括弯曲和多方向形式)的灵活检测。
  • 采用端到端多任务学习方式训练模型:同时进行目标检测、实例分割与分类,共享主干网络特征,降低计算成本。
  • 在特定数据集(如ICDAR2013、Total-Text)上使用MLT数据集预训练权重进行微调,以提升泛化能力。

实验结果

研究问题

  • RQ1全局语义上下文是否能显著减少场景文本检测中的误检,特别是对纹理与文本相似的物体?
  • RQ2基于分割激活的重评分机制是否能提升分类分数较弱的倾斜或低可见度文本的检测置信度?
  • RQ3基于Mask R-CNN并引入语义引导的框架,在检测任意形状文本(包括弯曲和多方向形式)方面能达到何种程度?
  • RQ4语义分割与重评分机制的融合是否能在具有不同文本形状与复杂度的多样化基准上带来一致的性能提升?
  • RQ5通过在检测与分割分支之间共享特征,该方法是否能以极低的计算开销维持高精度?

主要发现

  • 在ICDAR2013上,SPCNET实现92.1%的F1值,单尺度测试下超越此前最先进方法超过1.5个百分点。
  • 在ICDAR2015上,该方法取得87.2%的F1值,展现出在定向与多方向文本检测中的强大性能。
  • 在包含弯曲与多语言文本的挑战性Total-Text数据集中,SPCNET达到82.9%的F1值,优于先前方法。
  • 在ICDAR2017 MLT基准上,模型实现74.1%的F1值,表明其在多语言与多方向场景中的鲁棒性。
  • 定性结果表明,与EAST、RRPN和TextBoxes++等基线模型相比,SPCNET在杂乱场景中显著抑制了误检。
  • 重评分机制有效提升了倾斜文本的置信度,即使分类分数较低,也能借助强分割响应实现增强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。