Skip to main content
QUICK REVIEW

[论文解读] ICDAR 2019 Competition on Large-scale Street View Text with Partial Labeling -- RRC-LSVT

Yipeng Sun, Zihan Ni|arXiv (Cornell University)|Sep 17, 2019
Handwritten Text Recognition Techniques参考文献 30被引用 12
一句话总结

本论文介绍了 ICDAR 2019-LSVT 竞赛,提出了迄今为止最大的场景文本数据集——包含 450,000 幅街景图像,其中 50,000 幅为完全标注,400,000 幅为弱标注样本,用于文本检测与端到端检测识别。该挑战聚焦于利用部分标签提升模型鲁棒性,顶尖团队通过先进架构与模型集成实现了高性能,凸显了弱监督学习在真实世界文本理解中的潜力。

ABSTRACT

Robust text reading from street view images provides valuable information for various applications. Performance improvement of existing methods in such a challenging scenario heavily relies on the amount of fully annotated training data, which is costly and in-efficient to obtain. To scale up the amount of training data while keeping the labeling procedure cost-effective, this competition introduces a new challenge on Large-scale Street View Text with Partial Labeling (LSVT), providing 50, 000 and 400, 000 images in full and weak annotations, respectively. This competition aims to explore the abilities of state-of-the-art methods to detect and recognize text instances from large-scale street view images, closing the gap between research benchmarks and real applications. During the competition period, a total of 41 teams participated in the two proposed tasks with 132 valid submissions, i.e., text detection and end-to-end text spotting. This paper includes dataset descriptions, task definitions, evaluation protocols and results summaries of the ICDAR 2019-LSVT challenge.

研究动机与目标

  • 通过引入部分标注,解决大规模街景文本数据集完全标注成本高、效率低的问题。
  • 通过使用真实、复杂的街景图像,弥合研究基准与真实世界应用之间的差距。
  • 鼓励开发在弱监督下具有良好泛化能力的鲁棒模型,尤其针对检测与端到端检测识别任务。
  • 在包含任意文本形状、低对比度和遮挡等多样化真实世界挑战的大规模基准上评估最先进方法。
  • 推动弱监督学习在场景文本理解中的创新,重点在于利用大规模弱标注数据。

提出的方法

  • 从中国真实城市环境收集了 450,000 幅街景图像,其中 30,000 幅完全标注,400,000 幅弱标注。
  • 采用部分标签——每幅图像仅标注一个关键文本(如店铺名称),无边界框标注,以降低标注成本。
  • 组织了两个任务:文本检测(实例级定位)与端到端文本检测识别(检测 + 识别)。
  • 采用深度学习模型,如使用 ResNeXt、可变形卷积和 PANet 的 Mask R-CNN,以提升对长文本和弯曲文本的检测能力。
  • 采用 CNN-BiLSTM/GRU 与 CTC 及基于注意力的序列到序列模型进行端到端识别,并通过模型集成提升性能。
  • 集成空间变换网络(STN)与校正模块,以提升对不规则文本实例的识别效果。

实验结果

研究问题

  • RQ1当使用部分(弱)标注进行训练时,最先进模型在大规模、真实世界街景文本上的表现如何?
  • RQ2当前文本检测与识别模型在具有任意形状和低对比度背景的复杂真实场景中的主要失效模式是什么?
  • RQ3仅使用关键词级别标签的弱监督学习,与完全监督基线相比,能在多大程度上提升检测与识别性能?
  • RQ4模型集成与架构增强(如可变形卷积、注意力机制)在处理具有挑战性的文本实例时有多有效?
  • RQ5识别模块的反馈能否提升检测性能,尤其是在部分遮挡或低对比度情况下?

主要发现

  • 腾讯-DPPR 团队通过使用增强的主干网络与模型集成,在文本检测中取得了最高的 H-mean、精确率与召回率。
  • 华中科技大学(HUST)团队在召回率上排名第二,并通过结合空间变换网络(STN)的校正模块提升了识别鲁棒性。
  • 常见检测失败案例包括将垂直文本行误分为水平文本,表明需要结合语义线索改进分组策略。
  • 识别模型在低对比度背景和部分遮挡情况下表现不佳,凸显了对视觉退化更强不变性的需求。
  • 两阶段流程(检测 + 识别)虽有效,但未充分利用模块间的互补关系,提示联合优化可能带来更大收益。
  • 该数据集规模为此前基准的 14 倍,证明了其在训练具备强泛化能力与鲁棒性的现实世界数据模型方面的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。