[论文解读] WordFence: Text Detection in Natural Images with Border Awareness
WordFence 提出了一种基于语义分割与边界感知特征学习的端到端单词检测系统,并引入了一种新型像素级加权 Softmax 损失,以提升自然图像中单个单词的定位精度。通过高召回率的多尺度推理与基于投票的分割融合,该方法消除了后处理步骤,在 ICDAR13 上实现了 SOTA 的 86% F-score,在 ICDAR11/13 上实现了 92% 的召回率。
In recent years, text recognition has achieved remarkable success in recognizing scanned document text. However, word recognition in natural images is still an open problem, which generally requires time consuming post-processing steps. We present a novel architecture for individual word detection in scene images based on semantic segmentation. Our contributions are twofold: the concept of WordFence, which detects border areas surrounding each individual word and a novel pixelwise weighted softmax loss function which penalizes background and emphasizes small text regions. WordFence ensures that each word is detected individually, and the new loss function provides a strong training signal to both text and word border localization. The proposed technique avoids intensive post-processing, producing an end-to-end word detection system. We achieve superior localization recall on common benchmark datasets - 92% recall on ICDAR11 and ICDAR13 and 63% recall on SVT. Furthermore, our end-to-end word recognition system achieves state-of-the-art 86% F-Score on ICDAR13.
研究动机与目标
- 为解决自然图像中单词检测的挑战,其中文本在尺寸、字体、方向和质量方面差异显著。
- 通过语义分割实现端到端检测,消除对耗时后处理启发式方法的依赖。
- 通过边界感知特征学习,提升小尺寸和复杂文本区域的检测召回率与定位精度。
- 设计一种损失函数,强调文本与边界像素,增强对小尺寸和低对比度文本的训练信号。
- 通过结合高质量检测提议与强识别模型,实现端到端单词识别的 SOTA 性能。
提出的方法
- 提出 WordFence,一种新颖架构,通过检测单个单词周围的边界区域,确保精确的单词分离。
- 采用像素级加权 Softmax 损失函数,按类别像素数量进行归一化,对背景像素施加更高惩罚,并突出小尺寸文本区域。
- 使用空洞卷积的全卷积网络(FCNs),以保持空间分辨率并捕捉多尺度特征。
- 在输入图像上应用多尺度推理,生成不同分辨率的分割图,以提升检测鲁棒性。
- 在不同尺度间应用投票机制:通过逐像素求最大类别概率之和,合并上采样后的分割图,生成最终的去噪分割图。
- 从最终分割图中提取边界框,通过空间一致性最小化误检与重复检测。
实验结果
研究问题
- RQ1边界感知特征学习是否能提升自然场景图像中单个单词的分割与定位性能?
- RQ2一种对背景施加惩罚并强调小尺寸文本区域的加权 Softmax 损失,是否能带来更高的检测召回率与精度?
- RQ3结合投票机制的多尺度推理能否在无需后处理的情况下减少误检与重复?
- RQ4具有高召回率检测能力的端到端系统,在多大程度上可实现 SOTA 的单词识别性能?
- RQ5在 ICDAR11、ICDAR13 和 SVT 等标准基准上,该方法与现有方法相比,在召回率与 F-score 上表现如何?
主要发现
- WordFence 在 ICDAR11 和 ICDAR13 上实现了 92% 的定位召回率,相比先前的多尺度检测方法提升了 15%。
- 该模型在更具挑战性的 SVT 数据集上实现了 63% 的召回率,表明其对多样化文本条件具有鲁棒性。
- 端到端单词识别系统在 ICDAR13 上实现了 SOTA 的 86% F-score,优于先前方法。
- 所提出的加权 Softmax 损失显著增强了对小尺寸与低对比度文本区域的训练信号,减少了漏检。
- 基于投票的多尺度分割图融合方法有效减少了误检与重复,实现了高召回率而无需后处理。
- 该系统在不依赖手工设计启发式规则或基于知识的过滤机制的情况下,实现了具有竞争力的性能,证明了纯深度学习结合架构创新的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。