Skip to main content
QUICK REVIEW

[论文解读] Curved Text Detection in Natural Scene Images with Semi- and Weakly-Supervised Learning

Xugong Qin, Yu Zhou|arXiv (Cornell University)|Aug 27, 2019
Handwritten Text Recognition Techniques参考文献 33被引用 5
一句话总结

本文提出了一种用于弯曲文本检测的半监督与弱监督框架,通过利用少量像素级标注数据和大规模矩形框级或无标注数据,减少了对昂贵像素级标注的依赖。基于在有限像素标注数据上训练的基线模型,该方法通过真实边界框生成伪掩码标注,其中'局部'策略优于其他策略,在仅使用10%像素级数据和90%弱标注数据的情况下实现了最先进性能。

ABSTRACT

Detecting curved text in the wild is very challenging. Recently, most state-of-the-art methods are segmentation based and require pixel-level annotations. We propose a novel scheme to train an accurate text detector using only a small amount of pixel-level annotated data and a large amount of data annotated with rectangles or even unlabeled data. A baseline model is first obtained by training with the pixel-level annotated data and then used to annotate unlabeled or weakly labeled data. A novel strategy which utilizes ground-truth bounding boxes to generate pseudo mask annotations is proposed in weakly-supervised learning. Experimental results on CTW1500 and Total-Text demonstrate that our method can substantially reduce the requirement of pixel-level annotated data. Our method can also generalize well across two datasets. The performance of the proposed method is comparable with the state-of-the-art methods with only 10% pixel-level annotated data and 90% rectangle-level weakly annotated data.

研究动机与目标

  • 减少在自然场景图像中弯曲文本检测对昂贵像素级标注的依赖。
  • 开发一种半监督与弱监督学习框架,有效利用有限的像素级数据和丰富的弱标注或无标注数据。
  • 在仅使用少量全标注数据的情况下,提升在CTW1500和Total-Text等数据集上的泛化能力。
  • 设计一种新颖的伪掩码标注生成策略,利用弱监督设置下的真实边界框。

提出的方法

  • 训练一个多任务网络,同时执行边界框定位、文本/非文本分类和实例级掩码预测。
  • 首先在一小部分像素级标注数据(例如多边形掩码)上训练基线模型。
  • 基线模型使用三种策略(朴素、过滤、局部)为无标注或矩形框标注数据生成伪标注。
  • '局部'策略使用真实边界框作为提议,直接生成伪掩码标注,最大限度减少噪声并提高准确性。
  • 应用递归训练,即在一轮中预测的输出作为下一轮的监督信号,实现迭代优化。
  • 所提出的方法通过结合原始标注与来自无标注或弱标注数据集的伪标注,整合了半监督与弱监督学习。

实验结果

研究问题

  • RQ1能否仅使用10%像素级标注数据和90%矩形框级弱标注数据,有效训练弯曲文本检测器?
  • RQ2如何从弱标注的边界框中准确生成伪掩码标注,同时保留弯曲文本的空间与结构细节?
  • RQ3所提出的框架在CTW1500和Total-Text等不同数据集上是否具有良好的泛化能力?
  • RQ4在弱监督设置下,'朴素'、'过滤'和'局部'三种策略中,哪一种在F-score和召回率方面表现最佳?
  • RQ5在仅使用矩形框标注的情况下,能否在仅用一个数据集(如CTW1500)训练的模型有效泛化到另一个数据集(如Total-Text)?

主要发现

  • 在仅使用10%像素级数据和90%矩形框数据的情况下,'局部'策略在CTW1500上达到76.0%的F-score,在Total-Text上达到78.1%的F-score,优于基线模型和其他策略。
  • 在CTW1500上,'局部'策略使基线F-score提升9.9%,由于定位网络提供了完整监督,召回率显著提高。
  • 在Total-Text上,'局部'策略达到78.1%的F-score,与全监督训练的最先进方法(78.4%)非常接近。
  • 在CTW1500上,'过滤'策略相比'朴素'策略将精确率提高了1.7%,表明其在抑制误报方面更优。
  • '局部'策略在跨数据集泛化方面表现良好:在仅使用10%像素级数据的CTW1500上训练的模型,在Total-Text上无需任何目标域标注即可达到78.1%的F-score。
  • 递归训练在多轮中持续提升性能,其中'局部'策略表现出最快的收敛速度和最高的性能饱和度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。