[论文解读] FOTS: Fast Oriented Text Spotting with a Unified Network
FOTS 提出了一种用于快速定向文本检测的端到端、统一的深度学习框架,通过一种新颖的 RoIRotate 操作符在特征图中共享卷积特征,联合执行文本检测与识别。该方法在 ICDAR 2015 上实现了 SOTA 性能,推理速度达到 22.6 fps,F-measure 超过之前方法超过 5%,同时相比单任务检测网络,计算开销几乎可以忽略不计。
Incidental scene text spotting is considered one of the most difficult and valuable challenges in the document analysis community. Most existing methods treat text detection and recognition as separate tasks. In this work, we propose a unified end-to-end trainable Fast Oriented Text Spotting (FOTS) network for simultaneous detection and recognition, sharing computation and visual information among the two complementary tasks. Specially, RoIRotate is introduced to share convolutional features between detection and recognition. Benefiting from convolution sharing strategy, our FOTS has little computation overhead compared to baseline text detection network, and the joint training method learns more generic features to make our method perform better than these two-stage methods. Experiments on ICDAR 2015, ICDAR 2017 MLT, and ICDAR 2013 datasets demonstrate that the proposed method outperforms state-of-the-art methods significantly, which further allows us to develop the first real-time oriented text spotting system which surpasses all previous state-of-the-art results by more than 5% on ICDAR 2015 text spotting task while keeping 22.6 fps.
研究动机与目标
- 解决两阶段文本检测框架中因将检测与识别视为独立任务而造成的效率低下与特征学习不充分的问题。
- 将文本检测与识别统一为一个可端到端训练的网络,以改善特征共享并提升模型泛化能力。
- 开发一种计算高效的系统,实现实时推理,同时不牺牲定向场景文本的准确性。
- 提出一种可微分的 RoIRotate 操作符,以实现从特征图中定向感兴趣区域提取特征。
- 在标准基准测试(包括 ICDAR 2015、ICDAR 2017 MLT 和 ICDAR 2013)上展示显著优于现有方法的性能提升。
提出的方法
- 统一的全卷积神经网络在文本检测与识别分支之间共享早期卷积特征,以减少计算量并提升特征学习效果。
- 引入 RoIRotate 操作符作为可微分操作,用于从特征图中的旋转边界框中提取特征,从而支持端到端训练。
- 通过全卷积网络执行文本检测,利用回归头和分类头预测定向边界框。
- 将 RoIRotate 提取的特征输入 RNN 编码器,再通过 CTC 解码器进行序列预测,生成识别结果。
- 整个网络通过检测与识别损失的联合监督进行端到端训练,实现互补学习。
- 通过参数共享与网络架构蒸馏提升模型效率,轻量化版本(FOTS RT)采用 ResNet-34 实现实时部署。
实验结果
研究问题
- RQ1能否通过检测与识别的联合端到端训练,在提升性能的同时缩短推理时间?
- RQ2在检测与识别之间共享特征在提升模型泛化能力与降低计算成本方面有多有效?
- RQ3可微分的 RoIRotate 操作符是否能在统一网络中实现对任意方向文本区域的精确特征提取?
- RQ4检测与识别的联合监督在复杂场景中在多大程度上能减少误检并提升定位精度?
- RQ5统一框架是否能在不牺牲标准基准测试准确性的前提下实现实时推理速度?
主要发现
- 在 ICDAR 2015 文本检测基准上,FOTS 达到 68.5% 的 F-measure,较之前 SOTA 方法高出超过 15 个百分点。
- 在 ICDAR 2015 上,FOTS RT 实时模式下推理速度达 22.6 fps,显著快于两阶段基线(3.7 fps),接近单检测网络的速度(7.8 fps)。
- 该方法在 ICDAR 2013 和 ICDAR 2017 MLT 数据集上均优于所有现有方法,展现出检测与识别准确率的一致性提升。
- RoIRotate 操作符能够从旋转文本区域中实现精确的特征提取,有效减少如文本实例分裂或合并等定位错误。
- FOTS 通过识别监督学习字符级细节,减少误检,避免将类似文本的背景图案误分类为文本。
- 实时版本仅使用 28.79M 参数即达到 SOTA 性能,展现出高效率与良好的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。