[论文解读] Deep Scene Text Detection with Connected Component Proposals
本文提出一种双分支深度神经网络,将像素级分割与目标检测相结合,用于场景文本检测。通过在分割输出上使用连通域分析生成词候选区域,并引入一致性损失以对齐字符检测与这些候选区域,该方法在 ICDAR 2013 数据集上实现了 0.919 的 F 分数,显著提升了召回率至 0.915。
A growing demand for natural-scene text detection has been witnessed by the computer vision community since text information plays a significant role in scene understanding and image indexing. Deep neural networks are being used due to their strong capabilities of pixel-wise classification or word localization, similar to being used in common vision problems. In this paper, we present a novel two-task network with integrating bottom and top cues. The first task aims to predict a pixel-by-pixel labeling and based on which, word proposals are generated with a canonical connected component analysis. The second task aims to output a bundle of character candidates used later to verify the word proposals. The two sub-networks share base convolutional features and moreover, we present a new loss to strengthen the interaction between them. We evaluate the proposed network on public benchmark datasets and show it can detect arbitrary-orientation scene text with a finer output boundary. In ICDAR 2013 text localization task, we achieve the state-of-the-art performance with an F-score of 0.919 and a much better recall of 0.915.
研究动机与目标
- 通过整合自底向上的像素级线索与自顶向下的目标级检测,提升场景文本检测性能。
- 解决纯分割或检测方法在处理任意文本方向与复杂背景时的局限性。
- 通过字符候选与连通域候选区域之间新颖的一致性损失,减少误报并提升边界定位精度。
- 展示共享特征学习与联合训练在多任务场景文本检测中的有效性。
- 在公开基准上实现最先进性能,尤其在任意方向文本的召回率与 F 分数方面表现优异。
提出的方法
- 网络在两个分支中共享从 conv1_1 到 conv4_3 的 VGG-16 卷积层作为基础特征提取器。
- 分割分支执行像素级分类,并通过在分割图上应用标准连通域分析(CCA)生成词候选区域。
- 检测分支使用类似 Faster R-CNN 的头部预测字符候选区域,用于验证词候选区域。
- 引入一种新的一致性损失,以强制对齐原始 CCA 输出与检测到的字符边界框。
- 模型采用两阶段训练:首先分别预训练分割与检测头,然后使用衰减学习率进行联合微调。
- 真实标签包括文本区域(多边形)、中心线(文本区域高度的 50%),以及包含 95 个类别的字符边界框(含背景类)。
实验结果
研究问题
- RQ1联合学习分割与检测是否能提升场景文本检测性能,特别是在召回率与边界定位精度方面?
- RQ2在分割输出上使用连通域分析作为候选生成机制,是否优于传统的 RPN 或基于锚点的方法,尤其在任意方向文本检测中?
- RQ3在字符检测与 CCA 生成的候选区域之间强制实施一致性,能在多大程度上减少误报并提升定位精度?
- RQ4所提出的双分支架构结合共享特征与新颖的一致性损失,与单任务模型或简单拼接模型相比表现如何?
- RQ5该方法是否能泛化至多语言及非拉丁脚本?在这些具有挑战性的场景中是否仍能保持高性能?
主要发现
- 所提方法在 ICDAR 2013 Focused Text 数据集上实现了 0.919 的最先进 F 分数,所有提交结果中排名第一。
- 该方法实现了显著提升的召回率 0.915,表明在复杂场景中对真实文本实例的检测能力极强。
- 在分割输出上应用连通域分析,可有效检测任意方向与复杂形状的文本,在此方面优于基于锚点的方法。
- 字符检测与 CCA 候选区域之间的一致性损失有效减少了误报,并使文本边界预测更加清晰。
- 该方法在 Multilingual 数据集上也保持了强劲性能,证实其在中文等非拉丁脚本上的有效性。
- 消融实验表明,引入一致性损失的联合训练相比基线模型带来了可测量的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。