[论文解读] Improving Text Proposals for Scene Images with Fully Convolutional Networks
本文提出了一种新颖的方法,通过整合全卷积网络(FCNs)来重新排序由Text Proposals算法生成的文本候选框,从而提升场景图像中文本候选框的质量。通过利用FCN预测的文本概率热图,并结合使用分组质量得分的抑制策略,该方法在ICDAR和COCO-Text基准上实现了显著更少候选框数量下的最先进(SOTA)召回率,表现出优越的性能。
Text Proposals have emerged as a class-dependent version of object proposals - efficient approaches to reduce the search space of possible text object locations in an image. Combined with strong word classifiers, text proposals currently yield top state of the art results in end-to-end scene text recognition. In this paper we propose an improvement over the original Text Proposals algorithm of Gomez and Karatzas (2016), combining it with Fully Convolutional Networks to improve the ranking of proposals. Results on the ICDAR RRC and the COCO-text datasets show superior performance over current state-of-the-art.
研究动机与目标
- 提升场景图像中文本候选框的排序质量,以减少误报,同时保持高召回率。
- 解决原始Text Proposals方法的局限性,即尽管召回率高,但仍会产生大量误报。
- 利用全卷积网络(FCNs)的空间保留特征,实现更精确的文本区域评分。
- 将基于FCN的文本概率得分与Text Proposals中的分组质量得分相结合,以改进候选框排序。
- 在真实和合成数据集上评估不同排序与抑制策略的有效性。
提出的方法
- 该方法训练一个全卷积网络(FCN),以预测像素级文本概率,生成粗粒度的文本区域热图。
- 利用FCN生成的热图,根据每个候选框内平均文本概率对Text Proposals算法生成的候选框进行重新排序。
- 通过抑制策略将FCN的文本概率与Text Proposals原始的分组质量得分结合,以优化排序结果。
- 抑制阈值通过实验优化,0.10在ICDAR和COCO-Text数据集上表现最佳。
- 评估了不同训练数据源(COCO-Text、ICDAR、SYNTH)对泛化能力的影响,观察到性能差异极小。
- 最终的排序策略采用FCN置信度与分组质量的加权组合,优先选择匹配完整文本块范围的候选框。
实验结果
研究问题
- RQ1FCN预测的文本概率热图能否改善Text Proposals算法生成的文本候选框的排序?
- RQ2将FCN得分与分组质量得分结合后,对候选框召回率和精确率有何影响?
- RQ3在候选框排序中,合并FCN置信度与分组质量的最优抑制阈值是多少?
- RQ4在真实数据或合成数据上训练FCN,哪种数据能带来更好的文本候选框排序泛化性能?
- RQ5所提出方法与基线Text Proposals及最先进方法在标准基准上的表现如何比较?
主要发现
- 抑制阈值为0.10的策略在所有数据集和候选框数量下均实现了最高的检测率。
- 在ICDAR-Challenge4上,抑制策略(SUP_COCO 0.10)在1000个候选框下达到85%的检测率,优于基线(77%)和MTP策略。
- 在COCO-Text上,抑制策略在1000个候选框下实现78%的检测率,超过基线(63%)和MTP策略。
- 基于平均文本概率的排序策略(MTP)表现明显劣于基线,因其更倾向于选择小段文本而非完整文本块。
- 使用在COCO-Text上训练的FCN模型效果最佳,而在ICDAR或SYNTH数据上训练时性能差异极小。
- 定性结果证实,该方法在检测多语言、手写体以及具有不同方向和长度的形变文本方面具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。