[论文解读] Mask R-CNN with Pyramid Attention Network for Scene Text Detection
该论文提出了一种基于Mask R-CNN的场景文本检测框架,通过引入金字塔注意力网络(PAN)主干网络,增强了特征表示并抑制了文本状背景引起的误报。该方法仅使用单尺度、单模型推理,就在多方向文本(ICDAR-2015、ICDAR-2017 MLT)和弯曲文本(SCUT-CTW1500)基准上实现了最先进性能。
In this paper, we present a new Mask R-CNN based text detection approach which can robustly detect multi-oriented and curved text from natural scene images in a unified manner. To enhance the feature representation ability of Mask R-CNN for text detection tasks, we propose to use the Pyramid Attention Network (PAN) as a new backbone network of Mask R-CNN. Experiments demonstrate that PAN can suppress false alarms caused by text-like backgrounds more effectively. Our proposed approach has achieved superior performance on both multi-oriented (ICDAR-2015, ICDAR-2017 MLT) and curved (SCUT-CTW1500) text detection benchmark tasks by only using single-scale and single-model testing.
研究动机与目标
- 解决在自然场景图像中以高精度和鲁棒性检测多方向和弯曲文本的挑战。
- 通过用金字塔注意力网络(PAN)替换标准主干网络,改进Mask R-CNN在文本检测中的特征表示。
- 通过增强的特征学习,减少由文本状背景模式引起的误报。
- 在不依赖多尺度测试或识别头集成的情况下,实现在标准基准上的最先进性能。
提出的方法
- 将金字塔注意力网络(PAN)作为Mask R-CNN的新主干网络,以增强特征层次结构和表示能力。
- 利用PAN的跨尺度特征聚合和注意力机制,提升对复杂形状文本实例的检测能力。
- 采用统一的实例分割框架,通过掩码预测同时检测直线和弯曲文本。
- 使用单尺度测试和单模型推理,避免多尺度或集成推理的需要。
- 保留标准Mask R-CNN架构,但将特征提取器替换为PAN以提升特征学习能力。
- 在场景文本数据集上采用端到端训练,结合标准检测头和分割头。
实验结果
研究问题
- RQ1与标准主干网络相比,PAN是否能提升Mask R-CNN在场景文本检测中的特征表示能力?
- RQ2所提出的方法是否能有效抑制由文本状背景引起的假阳性?
- RQ3该模型是否仅通过单尺度、单模型推理就在多方向和弯曲文本检测基准上实现最先进性能?
- RQ4在ICDAR-2015、ICDAR-2017 MLT和SCUT-CTW1500上,PAN增强的Mask R-CNN与先前最先进方法相比表现如何?
主要发现
- 在ICDAR-2017 MLT上,该方法的F-measure达到0.743,即使不使用多尺度测试,也优于最接近的先前方法(F-measure为0.707)。
- 在ICDAR-2015上,该方法实现了0.859的F-measure,召回率为0.815,精确率为0.908,是该基准上报告的最佳结果。
- 在SCUT-CTW1500上,该方法以0.850的F-measure创下新SOTA,显著优于先前方法(例如,CTD+TLOC的F-measure为0.734)。
- 在所有数据集上,PAN作为主干网络均优于FPN,当在ICDAR-2017 MLT上使用ResNet50时,精确率绝对提升了4.3%。
- 定性结果表明,PAN能有效抑制由类似文本的纹理等背景引起的误报。
- 该方法在多种文本类型上均保持强大性能,包括弯曲、多方向和低分辨率实例。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。