Skip to main content
QUICK REVIEW

[论文解读] Feature Enhancement Network: A Refined Scene Text Detector

Sheng Zhang, Yuliang Liu|arXiv (Cornell University)|Nov 12, 2017
Handwritten Text Recognition Techniques参考文献 27被引用 17
一句话总结

本文提出了一种用于场景文本检测的特征增强网络(FEN),通过任务特定的低层与高层特征融合,提升对小尺寸和细长文本的检测性能。该方法引入了一种自适应加权的位置敏感RoI池化层以及正样本挖掘策略,以缓解样本不平衡问题,在ICDAR 2011和2013基准上实现了端到端训练下的最先进F-measure表现。

ABSTRACT

In this paper, we propose a refined scene text detector with a extit{novel} Feature Enhancement Network (FEN) for Region Proposal and Text Detection Refinement. Retrospectively, both region proposal with extit{only} $3 imes 3$ sliding-window feature and text detection refinement with extit{single scale} high level feature are insufficient, especially for smaller scene text. Therefore, we design a new FEN network with extit{task-specific}, extit{low} and extit{high} level semantic features fusion to improve the performance of text detection. Besides, since extit{unitary} position-sensitive RoI pooling in general object detection is unreasonable for variable text regions, an extit{adaptively weighted} position-sensitive RoI pooling layer is devised for further enhancing the detecting accuracy. To tackle the extit{sample-imbalance} problem during the refinement stage, we also propose an effective extit{positives mining} strategy for efficiently training our network. Experiments on ICDAR 2011 and 2013 robust text detection benchmarks demonstrate that our method can achieve state-of-the-art results, outperforming all reported methods in terms of F-measure.

研究动机与目标

  • 为解决现有场景文本检测器在检测小尺寸和细长文本区域方面的局限性。
  • 通过任务特定的方式融合低层与高层语义特征,提升检测精度。
  • 通过有效的正样本挖掘策略,缓解优化阶段的样本不平衡问题。
  • 通过自适应加权的位置敏感RoI池化层,增强区域建议与检测优化。
  • 在标准ICDAR 2011和2013基准上实现最先进性能,实现鲁棒的场景文本检测。

提出的方法

  • 提出一种特征增强网络主干(FENS),通过融合低层与高层特征,提升文本检测中的特征表示能力。
  • 引入特征增强RPN(FE-RPN)与超特征生成模块,以增强区域建议与检测优化。
  • 设计一种自适应加权的位置敏感RoI池化层,以更好处理文本区域中可变的长宽比。
  • 开发一种正样本挖掘策略,在训练过程中平衡正负样本,提升模型收敛性。
  • 采用多尺度测试结合非极大值抑制(NMS),聚合不同输入分辨率下的预测结果。
  • 通过联合优化区域建议与优化阶段,实现端到端的网络训练。

实验结果

研究问题

  • RQ1任务特定的低层与高层特征融合是否能提升对小尺寸和细长场景文本的检测性能?
  • RQ2自适应加权的位置敏感RoI池化是否在检测可变长宽比文本区域方面优于标准的统一池化?
  • RQ3专门设计的正样本挖掘策略是否能有效缓解检测优化阶段的样本不平衡问题?
  • RQ4与现有最先进方法相比,所提出的FEN框架在标准ICDAR基准上的F-measure提升程度如何?

主要发现

  • 在ICDAR 2011和2013数据集上,所提出的FEN框架相较于原始R-FCN基线模型,平均召回率提升5%,F-measure提升3%。
  • 与标准池化相比,自适应加权的位置敏感RoI池化在ICDAR 2013上使F-measure提升1.9%,在ICDAR 2011上提升1.1%。
  • 正样本挖掘策略将正样本与负样本的比例从不足1:4提升至约2:5,有效缓解了严重的类别不平衡问题。
  • 通过多尺度测试,该方法在ICDAR 2011和2013基准上均实现了最先进F-measure,优于所有先前报告的方法。
  • 尽管输入图像短边长度仅为720,该方法仍保持高性能,表明其对输入分辨率变化具有鲁棒性。
  • 尽管架构有所增强,该模型仍保持了与其它最先进方法相当的推理速度,具备良好的推理效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。