[论文解读] TextCohesion: Detecting Text for Arbitrary Shapes
TextCohesion 提出了一种新颖的逐像素文本检测方法,将文本实例分解为文本骨架(Text Skeleton)和四个方向像素区域(Directional Pixel Regions, DPRs),从而实现对任意形状文本的鲁棒检测。通过利用置信度评分机制过滤假阳性结果,该方法在 Total-Text 上取得了 84.6% 的 SOTA F-measure,在 SCUT-CTW1500 上达到了 86.3%,在曲线文本和复杂文本基准测试中优于现有方法。
In this paper, we propose a pixel-wise method named TextCohesion for scene text detection, which splits a text instance into five key components: a Text Skeleton and four Directional Pixel Regions. These components are easier to handle than the entire text instance. A confidence scoring mechanism is designed to filter characters that are similar to text. Our method can integrate text contexts intensively when backgrounds are complex. Experiments on two curved challenging benchmarks demonstrate that TextCohesion outperforms state-of-the-art methods, achieving the F-measure of 84.6% on Total-Text and bfseries86.3% on SCUT-CTW1500.
研究动机与目标
- 为解决在复杂背景中检测任意形状文本(尤其是曲线和多方向实例)的挑战。
- 通过整合上下文信息,克服由类似文本的字符或符号引起的假阳性检测问题。
- 提高不规则形状文本实例的边界定位精度,这些形状无法适配标准边界框。
- 开发一种对复杂场景具有鲁棒性,并在各种文本布局中保持高精度和高召回率的方法。
- 引入置信度评分机制,通过过滤非文本模式来提升检测的可靠性。
提出的方法
- TextCohesion 将每个文本实例建模为文本骨架(TS)和四个方向像素区域(DPRs)的组合,分别表示中心路径和来自四个方向的边缘优化。
- 文本骨架用于初始化检测,像素沿 DPR 方向从 TS 向外传播,以重建完整的文本区域。
- 每个像素可属于多个 DPR,从而支持多条恢复路径,提升对部分或噪声边缘的鲁棒性。
- 置信度评分机制计算文本骨架中像素的平均置信度分数;仅当分数高于阈值(例如 0.5)时,才视为有效候选。
- 该方法使用在 SynthText 上预训练并针对基准数据集微调的深度学习网络,对不同数据集采用自适应阈值。
- 模型使用 Adam 优化器进行训练,学习率衰减;推理在单张 GPU 上以批量大小 4 执行。
实验结果
研究问题
- RQ1将文本分解为中心骨架和方向边缘区域,是否能提升在曲线和不规则形状文本上的检测性能?
- RQ2置信度评分机制在过滤由类似文本的符号或字符引起的假阳性方面有多有效?
- RQ3从方向区域出发的多路径传播是否能增强复杂背景下的边界恢复和检测精度?
- RQ4所提出的方法是否能在不依赖固定形状边界框的前提下,泛化于各种文本形状和方向?
- RQ5上下文信息的整合在具有挑战性的检测场景中,对提升精度的贡献有多大?
主要发现
- TextCohesion 在 Total-Text 基准测试中实现了 84.6% 的 F-measure,超越了所有先前的 SOTA 方法。
- 在 SCUT-CTW1500 基准测试中,该方法达到了 86.3% 的 F-measure,创下新的 SOTA 性能记录。
- 置信度评分机制使 SCUT-CTW1500 上的精度从 82.3% 提升至 88.0%,证明其在减少假阳性方面的有效性。
- 该方法在曲线文本上的表现优于基于回归的模型(如 EAST 和 TextBox++),后者在非矩形形状上表现不佳。
- 使用多个方向区域可实现更好的边界恢复,尤其在相邻或重叠边缘的情况下。
- 消融实验表明,置信度评分机制显著提升了检测的可靠性,尤其是在杂乱场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。