[论文解读] ShopSign: a Diverse Scene Text Dataset of Chinese Shop Signs in Street Views
本论文提出 ShopSign,一个大规模、多样化且具有挑战性的中文店铺招牌图像数据集,包含来自街景的 25,362 幅图像,共标注了 196,010 条文本行。在 ShopSign 及相关数据集上评估了当前最先进场景文本检测器(EAST、TextBoxes++、CTPN),结果表明在 ShopSign 上进行训练可显著提升性能,尤其是在镜像、遮挡和形变文本等困难样本上表现突出。
In this paper, we introduce the ShopSign dataset, which is a newly developed natural scene text dataset of Chinese shop signs in street views. Although a few scene text datasets are already publicly available (e.g. ICDAR2015, COCO-Text), there are few images in these datasets that contain Chinese texts/characters. Hence, we collect and annotate the ShopSign dataset to advance research in Chinese scene text detection and recognition. The new dataset has three distinctive characteristics: (1) large-scale: it contains 25,362 Chinese shop sign images, with a total number of 196,010 text-lines. (2) diversity: the images in ShopSign were captured in different scenes, from downtown to developing regions, using more than 50 different mobile phones. (3) difficulty: the dataset is very sparse and imbalanced. It also includes five categories of hard images (mirror, wooden, deformed, exposed and obscure). To illustrate the challenges in ShopSign, we run baseline experiments using state-of-the-art scene text detection methods (including CTPN, TextBoxes++ and EAST), and cross-dataset validation to compare their corresponding performance on the related datasets such as CTW, RCTW and ICPR 2018 MTWI challenge dataset. The sample images and detailed descriptions of our ShopSign dataset are publicly available at: https://github.com/chongshengzhang/shopsign.
研究动机与目标
- 为解决中文场景文本检测与识别领域缺乏大规模、多样化且具有挑战性的数据集的问题。
- 从多样化城市与乡村环境收集并标注大规模真实世界中文店铺招牌数据集。
- 通过五类困难图像类别(镜像、木质、形变、暴露、遮挡)对中文场景文本检测的难度进行表征与量化。
- 在 ShopSign 及相关数据集上评估最先进场景文本检测模型的性能,以揭示现有局限性。
- 通过提供包含真实且具有挑战性的样本的基准数据集,激发中文 Photo OCR 领域的进一步研究。
提出的方法
- 使用 50 多部不同手机设备,从 20 多个城市收集了 25,362 幅中文店铺招牌街景图像,以确保成像条件的多样性。
- 采用基于文本行的标注方案,人工标注图像中的所有文本行,确保每条文本行均有精确的边界框。
- 根据视觉与识别挑战,将图像划分为五类困难类别:镜像、木质、形变、暴露和遮挡。
- 在 ShopSign 上训练并评估三种最先进场景文本检测模型(EAST、TextBoxes++、CTPN),并在 CTW、RCTW 和 MTWI 数据集上进行跨数据集验证。
- 通过图像级与文本行级召回分析,衡量模型在困难样本上的检测性能,比较使用与不使用 ShopSign 微调的模型表现。
- 采用跨数据集训练与评估,以评估模型在复杂或罕见文本布局上的泛化能力与性能提升,尤其针对罕见或复杂排版的文本。
实验结果
研究问题
- RQ1现有场景文本检测模型在具有多样化视觉条件的真实中文店铺招牌上的泛化性能如何?
- RQ2在训练中引入 ShopSign 数据集在多大程度上提升了对镜像、遮挡或形变文本等困难样本的检测性能?
- RQ3中文字符在场景文本检测中带来了哪些具体挑战,它们如何影响模型的召回率与精确率?
- RQ4在训练数据中包含 ShopSign 后,对 CTW 和 RCTW 等基准数据集上 EAST、TextBoxes++ 和 CTPN 等模型的性能产生了何种影响?
- RQ5当前深度学习模型在复杂真实环境中检测中文场景文本时,其主要失败模式是什么?
主要发现
- ShopSign 包含 25,362 幅图像,共 196,010 条文本行,数据采集自多样化的地理区域与设备条件,是目前最大的真实世界中文场景文本数据集之一。
- 当在 ShopSign 上进行训练时,EAST、TextBoxes++ 和 CTPN 等基线模型在困难样本上的召回率显著提升,尤其在遮挡和镜像文本上表现突出。
- 在五类困难图像类别中,EAST 和 CTPN 在镜像与遮挡文本上的召回率低于 41.2%,表明检测难度极高。
- TextBoxes++ 相较于 EAST 和 CTPN 展现出更强的鲁棒性,尤其在镜像与遮挡文本上表现更优。
- 通过在 ShopSign 上进行跨数据集训练,CTW、RCTW 和 MTWI 的平均平均精度(mAP)与召回率均得到提升,表明其作为数据增强资源具有重要价值。
- 该数据集揭示了严重的数据稀疏性与类别不平衡问题,特别是对于罕见中文字符,提示未来工作需借助 GAN 生成合成数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。