[论文解读] Geometry Normalization Networks for Accurate Scene Text Detection
本文提出几何归一化网络(GNNets),一种新颖的框架,通过使用多分支几何归一化模块(GNM)中的尺度与方向归一化单元,将文本实例归一化到规范几何范围,从而提升场景文本检测性能。该方法在单次前向推理下实现了最先进性能,在ICDAR 2015上达到88.52的F-score,在ICDAR 2017 MLT上达到74.54,显著优于先前方法在旋转基准上的表现。
Large geometry (e.g., orientation) variances are the key challenges in the scene text detection. In this work, we first conduct experiments to investigate the capacity of networks for learning geometry variances on detecting scene texts, and find that networks can handle only limited text geometry variances. Then, we put forward a novel Geometry Normalization Module (GNM) with multiple branches, each of which is composed of one Scale Normalization Unit and one Orientation Normalization Unit, to normalize each text instance to one desired canonical geometry range through at least one branch. The GNM is general and readily plugged into existing convolutional neural network based text detectors to construct end-to-end Geometry Normalization Networks (GNNets). Moreover, we propose a geometry-aware training scheme to effectively train the GNNets by sampling and augmenting text instances from a uniform geometry variance distribution. Finally, experiments on popular benchmarks of ICDAR 2015 and ICDAR 2017 MLT validate that our method outperforms all the state-of-the-art approaches remarkably by obtaining one-forward test F-scores of 88.52 and 74.54 respectively.
研究动机与目标
- 为解决场景文本检测中大规模几何差异(如尺度与方向)带来的挑战,这些差异会限制基于CNN检测器的性能。
- 通过受控实验探究现有网络在处理广泛几何变化时的局限性。
- 开发一种可泛化的即插即用模块,将文本实例归一化到规范几何范围,以提升检测鲁棒性。
- 设计一种几何感知训练策略,确保所有归一化分支之间的梯度更新均衡。
- 在标准基准上实现最先进性能,尤其在大方向差异条件下表现优异。
提出的方法
- 提出一种多分支并行的几何归一化模块(GNM),每个分支结合尺度归一化单元(SNU)与方向归一化单元(ONU),将文本特征转换至规范几何空间。
- 每个SNU使用不同尺度因子(如S和S₁/₂)实现尺度归一化,每个ONU使用不同旋转类型(如O、Or、Of、Or+f)实现旋转归一化。
- GNM生成多个几何归一化特征图,输入至单一共享文本检测头,实现端到端训练与推理。
- 引入一种几何感知训练方案,从几何差异的均匀分布中采样并增强文本实例,以确保所有分支的梯度更新均衡。
- 采用数据增强技术在训练过程中模拟多样化的方向与尺度,提升GNM各分支的泛化能力与稳定性。
- 该框架与现有基于CNN的检测器兼容,可无缝集成至EAST与PSENet等模型中,形成GNNets。
实验结果
研究问题
- RQ1基于CNN的标准检测器能否有效从具有大几何差异的场景文本检测训练数据中学习?
- RQ2几何差异(尤其是方向)在多大程度上会降低现有场景文本检测器的性能?
- RQ3多分支归一化模块是否能通过将文本特征映射到规范空间,有效减轻几何差异的影响?
- RQ4一种在几何分布上实现采样均衡的几何感知训练策略,是否能提升归一化分支的泛化能力?
- RQ5所提出的GNNets能否在标准与旋转场景文本基准上均实现最先进性能?
主要发现
- 所提出的GNNets在ICDAR 2015上实现88.52的F-score,在ICDAR 2017 MLT上实现74.54的F-score,且仅需一次前向推理,优于所有先前最先进方法。
- 在旋转ICDAR 2015基准上,GNNets相较EAST基线实现3倍性能提升,证明其对大方向差异具有强大鲁棒性。
- 相较于原始PSENet,GNNets在ICDAR 2015上提升F-score 1.3%,在ICDAR 2017 MLT上提升2.1%,尽管仅使用检测标注与一次前向推理。
- 在ICDAR 2015上,GNNets较FOTS提升0.6%,在ICDAR 2017 MLT上提升7.3%,即使FOTS在训练中使用了检测与识别双重标注。
- 在ICDAR 2017 MLT上,GNNets相较Pixel-Anchor实现6.4%的性能提升,凸显其在处理复杂几何形态方面的有效性。
- 定性结果表明,GNNets能成功检测具有极端方向与尺度的文本实例,验证了几何归一化策略的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。