[论文解读] Weakly-Supervised Arbitrary-Shaped Text Detection with Expectation-Maximization Algorithm
本文提出一种基于期望最大化(EM)算法的弱监督框架,用于任意形状文本检测,采用基于轮廓的检测器,利用多种弱监督形式(图像级标签、粗略、松散和紧密边界框)。仅使用10%的多边形级标注数据和90%的弱标注数据,该方法在CTW1500、Total-Text和ICDAR-ArT基准上达到与全监督模型相当的性能,同时在全监督设置下优于当前最先进方法。
Arbitrary-shaped text detection is an important and challenging task in computer vision. Most existing methods require heavy data labeling efforts to produce polygon-level text region labels for supervised training. In order to reduce the cost in data labeling, we study weakly-supervised arbitrary-shaped text detection for combining various weak supervision forms (e.g., image-level tags, coarse, loose and tight bounding boxes), which are far easier for annotation. We propose an Expectation-Maximization (EM) based weakly-supervised learning framework to train an accurate arbitrary-shaped text detector using only a small amount of polygon-level annotated data combined with a large amount of weakly annotated data. Meanwhile, we propose a contour-based arbitrary-shaped text detector, which is suitable for incorporating weakly-supervised learning. Extensive experiments on three arbitrary-shaped text benchmarks (CTW1500, Total-Text and ICDAR-ArT) show that (1) using only 10% strongly annotated data and 90% weakly annotated data, our method yields comparable performance to state-of-the-art methods, (2) with 100% strongly annotated data, our method outperforms existing methods on all three benchmarks. We will make the weakly annotated datasets publicly available in the future.
研究动机与目标
- 通过利用易于获取的弱监督形式,降低任意形状文本检测中多边形级标签的高标注成本。
- 开发一种弱监督学习框架,有效结合有限的强标注与丰富的弱标注。
- 设计一种兼容多种弱监督格式的基于轮廓的检测器,以提升泛化能力与训练效率。
- 证明弱监督训练可实现接近全监督模型的性能,同时大幅减少标注工作量。
提出的方法
- 提出一种基于轮廓的任意形状文本检测器,先生成文本提议,再回归精确轮廓,与弱监督形式高度契合。
- 引入四种弱监督形式:图像级标签、粗略、松散和紧密边界框,每种形式所需标注时间逐步减少。
- 采用类似EM的优化算法,其中E步估计潜在多边形标签的概率分布,M步使用伪标签多边形更新模型权重。
- 使用在少量强标注数据上预训练的模型初始化EM过程,提升收敛速度与最终性能。
- 应用置信度加权损失函数,降低噪声伪标签对训练的影响。
- 进行多轮迭代EM训练,性能在前两轮提升,但第三轮因伪标签误差累积而停滞或下降。
实验结果
研究问题
- RQ1图像级标签和边界框等弱监督形式能否显著降低标注成本,同时保持高检测准确率?
- RQ2基于EM的学习框架在利用有限强标注与丰富弱标注进行任意形状文本检测方面效果如何?
- RQ3不同弱监督形式(如紧密与松散边界框)对模型性能与标注效率有何影响?
- RQ4当仅10%的数据为强标注时,弱监督模型在多大程度上可达到全监督模型的性能?
主要发现
- 仅使用10%强标注数据和90%弱标注数据,该方法在CTW1500、Total-Text和ICDAR-ArT上的F1值与全监督最先进方法相当。
- 在100%强标注数据下,该方法在所有三个基准上均优于现有方法,证明其在全监督设置下具有更优的准确性。
- 置信度加权损失使F1值提升约2.1–2.5%,有效降低噪声伪标签的影响。
- 性能在前两轮EM训练中持续提升,但第三轮因伪标签误差累积而趋于平稳或下降。
- '等时间'和'等数量'弱标注策略在F1值上均优于'强'策略(全多边形标注)超过3.9个百分点,表明其成本效益更优。
- 松散边界框是最具成本效益的弱监督形式,在20%预算用于弱标注、80%用于多边形标注时表现最佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。