[论文解读] Detecting Text in Natural Image with Connectionist Text Proposal Network
该论文提出连接性文本提议网络(CTPN),一种深度学习模型,通过利用垂直锚点和双向LSTM,在卷积特征图中直接检测自然图像中的文本行。该方法在ICDAR 2013上实现0.88的F-measure,在ICDAR 2015上实现0.61的F-measure,使用VGG16主干网络时每张图像推理时间为0.14秒。
We propose a novel Connectionist Text Proposal Network (CTPN) that accurately localizes text lines in natural image. The CTPN detects a text line in a sequence of fine-scale text proposals directly in convolutional feature maps. We develop a vertical anchor mechanism that jointly predicts location and text/non-text score of each fixed-width proposal, considerably improving localization accuracy. The sequential proposals are naturally connected by a recurrent neural network, which is seamlessly incorporated into the convolutional network, resulting in an end-to-end trainable model. This allows the CTPN to explore rich context information of image, making it powerful to detect extremely ambiguous text. The CTPN works reliably on multi-scale and multi- language text without further post-processing, departing from previous bottom-up methods requiring multi-step post-processing. It achieves 0.88 and 0.61 F-measure on the ICDAR 2013 and 2015 benchmarks, surpass- ing recent results [8, 35] by a large margin. The CTPN is computationally efficient with 0:14s/image, by using the very deep VGG16 model [27]. Online demo is available at: http://textdet.com/.
研究动机与目标
- 解决依赖多步后处理且对错误字符检测敏感的自底向上文本检测方法的局限性。
- 通过直接在卷积特征图中检测文本行而非单个字符,提升场景文本的定位精度。
- 实现端到端训练深度网络,联合预测文本存在性、位置及序列提议的优化偏移量。
- 在无需额外后处理或语言特异性调整的情况下,增强对多尺度和多语言文本的鲁棒性。
- 在基准数据集上实现高性能的同时,保持计算效率以支持实时推理。
提出的方法
- 提出一种垂直锚点机制,在特征图高度范围内生成固定宽度的文本提议,每个锚点预测文本/非文本得分及y轴坐标。
- 集成双向长短期记忆网络(BLSTM),对水平方向上相邻提议之间的序列依赖关系进行建模,实现上下文感知检测。
- 以预训练VGG16网络的最后一个卷积层(conv5)作为输入,通过3×3滑动窗口为每个提议提取局部特征。
- 采用双流RNN架构,每个提议的特征由BLSTM处理,分别编码从左到右和从右到左的上下文,提升定位精度。
- 使用联合损失函数端到端训练整个网络,损失函数包含分类(文本/非文本)、边界框回归(y坐标和侧向优化)及序列建模。
- 推理阶段仅进行一次非极大值抑制(NMS)以抑制重叠提议,减少对复杂后处理流水线的依赖。
实验结果
研究问题
- RQ1深度神经网络能否在不依赖字符级检测的情况下,直接在卷积特征图中检测完整的文本行?
- RQ2与独立提议预测相比,对序列提议进行循环建模如何提升场景文本检测中的定位精度?
- RQ3结合回归与分类的垂直锚点机制在具有挑战性的多尺度、多语言文本上,能在多大程度上提升检测性能?
- RQ4端到端可训练架构是否能在准确率和效率上超越多阶段、后处理驱动的方法?
- RQ5在特征提取流水线中集成RNN是否能增强对模糊或小尺度文本的检测能力?
主要发现
- CTPN在ICDAR 2013基准上实现0.88的F-measure,显著超越此前最先进方法。
- 在ICDAR 2015基准上,模型实现0.61的F-measure,展现出对多样化且具有挑战性的文本实例的强大泛化能力。
- 模型能以高精度检测极小尺度和模糊的文本行,甚至在某些情况下优于真实标注。
- 使用VGG16主干网络时,每张图像的推理时间为0.14秒,适用于实时应用的计算效率。
- 该方法在无需语言特异性调整的情况下,对多语言文本(包括中文和韩文)具有良好泛化能力。
- 通过减少对后处理的依赖,CTPN简化了处理流程,并通过降低多阶段序列误差累积提升了鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。