[论文解读] Open Images V5 Text Annotation and Yet Another Mask Text Spotter
本文介绍了针对 Open Images V5 的最大规模公开人类标注文本数据集,包含对场景文本实例的精确定位与转录。利用该数据集,作者训练了一个基于 Mask-RCNN 的简单模型——Yet Another Mask Text Spotter (YAMTS),在 ICDAR 2013、ICDAR 2015 和 Total-Text 基准测试中实现了最先进或具有竞争力的性能,经微调后在 Total-Text 上实现了 74.5% 的端到端识别率。
A large scale human-labeled dataset plays an important role in creating high quality deep learning models. In this paper we present text annotation for Open Images V5 dataset. To our knowledge it is the largest among publicly available manually created text annotations. Having this annotation we trained a simple Mask-RCNN-based network, referred as Yet Another Mask Text Spotter (YAMTS), which achieves competitive performance or even outperforms current state-of-the-art approaches in some cases on ICDAR2013, ICDAR2015 and Total-Text datasets. Code for text spotting model available online at: https://github.com/openvinotoolkit/training_extensions. The model can be exported to OpenVINO-format and run on Intel CPUs.
研究动机与目标
- 创建并发布针对 Open Images V5 的最大规模公开人工标注文本数据集,以提升场景文本定位模型的训练效果。
- 开发一种简单但高效的基于 Mask-RCNN 的模型(YAMTS),实现端到端文本定位,且无需复杂架构修改即可实现具有竞争力的性能。
- 证明在新发布的 Open Images V5 文本标注数据集上进行训练,可显著提升模型在标准基准测试中的泛化能力与性能表现。
- 通过导出为 OpenVINO™ 格式,实现模型在 Intel CPU 上的高效推理部署。
提出的方法
- 作者收集并发布了来自 Open Images V5 的大规模人工标注文本数据集,包含精确的多边形边界框与文本转录。
- 采用标准训练流程,训练基于 Mask-RCNN 的架构并增加一个文本识别头,未使用特殊模块或数据增强技巧。
- 通过冻结除文本识别头外的所有层,对模型进行微调,优化 130K 次迭代以提升识别准确率。
- 通过导出为 OpenVINO™ 格式,实现模型推理,支持在 Intel CPU 上高效部署。
- 使用标准指标(包括单词定位与端到端识别,采用多种词典)在 ICDAR 2013、ICDAR 2015、Total-Text 和 Open Images V5 验证集上评估模型性能。
- 通过在不使用 Open Images V5 文本标注数据的情况下重新训练模型,开展消融实验,以隔离其对性能提升的贡献。
实验结果
研究问题
- RQ1在大规模、高质量的人工标注场景文本数据集(如 Open Images V5)上进行训练,对标准 Mask-RCNN 架构的文本定位模型性能有何影响?
- RQ2仅使用标准文本识别头的简单 Mask-RCNN 架构是否能在不引入复杂架构或专用模块的情况下,实现在标准基准测试中的最先进性能?
- RQ3仅微调文本识别头在多大程度上能提升识别准确率,特别是在弯曲文本与多方向文本上?
- RQ4包含 Open Images V5 文本标注数据在多大程度上提升了模型的泛化能力,如在未见数据集(如 Total-Text 和 ICDAR 2015)上的表现?
主要发现
- YAMTS 在使用通用词典和 1280x768 输入分辨率时,在 ICDAR 2015 上实现了 74.1% 的端到端识别率,优于多个先前方法。
- 在冻结其他所有层、仅微调文本识别头后,YAMTS 在 Total-Text 上达到 74.5% 的端到端识别率,与在更大 TextOCR 数据集上微调的 Mask TextSpotter v3 性能相当。
- 在未进行微调的情况下,YAMTS 在 Total-Text 上实现了 73.7% 的端到端识别率,表明其在弯曲和多方向文本上具备强大的基线性能。
- 消融实验表明,若排除 Open Images V5 文本标注数据,性能显著下降,证实该数据集在模型泛化中的关键作用。
- 在 Open Images V5 验证集上,YAMTS 在 1600x960 输入分辨率下实现了 56.3% 的端到端识别率,表明其对源数据集具有强大的零样本泛化能力。
- 结果表明,即使使用简单标准架构,高质量的大规模人工标注数据也能显著提升模型性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。