Skip to main content
QUICK REVIEW

[论文解读] ArbiText: Arbitrary-Oriented Text Detection in Unconstrained Scene

Daitao Xing, Zichen Li|arXiv (Cornell University)|Nov 30, 2017
Handwritten Text Recognition Techniques参考文献 31被引用 6
一句话总结

ArbiText 提出了一种无需区域建议、基于单次检测的任意方向文本检测方法,通过在 SSD 框架内使用圆形锚框和金字塔池化模块,实现了在 ICDAR 2015 和 MSRA-TD500 数据集上的最先进性能,F-score 分别达到 75.9% 和 75.0%,推理速度为 12.1 FPS,展示了在复杂条件下对旋转、多语言及长文本行检测的卓越精度与效率。

ABSTRACT

Arbitrary-oriented text detection in the wild is a very challenging task, due to the aspect ratio, scale, orientation, and illumination variations. In this paper, we propose a novel method, namely Arbitrary-oriented Text (or ArbText for short) detector, for efficient text detection in unconstrained natural scene images. Specifically, we first adopt the circle anchors rather than the rectangular ones to represent bounding boxes, which is more robust to orientation variations. Subsequently, we incorporate a pyramid pooling module into the Single Shot MultiBox Detector framework, in order to simultaneously explore the local and global visual information, which can, therefore, generate more confidential detection results. Experiments on established scene-text datasets, such as the ICDAR 2015 and MSRA-TD500 datasets, have demonstrated the supe rior performance of the proposed method, compared to the state-of-the-art approaches.

研究动机与目标

  • 为在高精度和高效率下检测非受限自然场景中的任意方向、多尺度和多语言文本提供解决方案。
  • 克服传统矩形锚框在处理场景文本中方向和长宽比变化时的局限性。
  • 通过金字塔池化模块融合局部与全局视觉特征,提升检测鲁棒性。
  • 消除区域建议网络的需求,从而提升计算效率。
  • 提出一种新型掩码损失函数,以处理因可变尺寸圆形锚框导致的正样本分配模糊性。

提出的方法

  • 使用圆形锚框替代矩形锚框,以更准确地表示旋转和任意方向的文本边界框。
  • 将金字塔池化模块集成到 SSD 框架中,以提取多尺度特征并同时保留局部与全局上下文信息。
  • 采用改进的损失函数,并引入新的掩码类别,以解决可变尺寸圆形锚框在正样本分配中的模糊性问题。
  • 应用数据增强技术,包括随机裁剪、水平翻转和随机旋转(±15° 至 ±90°),以提升模型鲁棒性。
  • 在后处理阶段应用局部感知非极大值抑制(LANMS)以抑制重叠检测结果。
  • 使用轻量级 VGG-16 主干网络进行端到端训练,并在 ICDAR 2015 和 MSRA-TD500 数据集上进行微调。

实验结果

研究问题

  • RQ1在不同尺度和方向下,圆形锚框是否能优于矩形锚框,实现对任意方向文本的检测?
  • RQ2通过捕捉多尺度上下文信息,集成金字塔池化模块是否能提升场景文本的检测性能?
  • RQ3无区域建议的单次检测器是否能在保持高推理速度的同时实现最先进精度?
  • RQ4所提出的掩码损失函数在处理可变尺寸圆形锚框和模糊正样本时是否有效?
  • RQ5该模型是否能在不修改网络架构的情况下,对长文本行和多语言文本(包括非拉丁字符脚本)实现良好泛化?

主要发现

  • 在 ICDAR 2015 Incidental Text 数据集上,ArbiText 的 F-score 达到 75.9%,比之前最先进方法(Seglink)高出 0.9 个百分点。
  • 在 MSRA-TD500 数据集上,ArbiText 的 F-score 达到 75.0%,在 F-measure 指标上与最佳性能方法持平,同时实现了最高的推理速度(12.1 FPS)。
  • 该模型在无需超参数调优的情况下,对长文本行和多语言文本(包括中英文混合文本)表现出强大的泛化能力。
  • 使用圆形锚框显著提升了对方向变化的检测鲁棒性,尤其在曲线或旋转文本场景中表现更优。
  • 所提出的掩码损失函数有效解决了正样本分配中的模糊性问题,从而提升了精确率与召回率。
  • 失败案例揭示了在检测曲线文本和手写文本方面仍存在局限,表明在建模可变形文本形状方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。