[论文解读] Convolutional Character Networks
本文提出 CharNet,一种单阶段端到端卷积神经网络,通过将字符作为基本单元而非单词,在一次前向传播中联合检测文本实例并识别字符。通过用轻量级 CNN 分支替代基于 RNN 的识别模块,并引入迭代字符检测策略以实现领域泛化,CharNet 在 ICDAR 2015 和 Total-Text 上达到最先进性能,端到端识别 F-measure 分别提升至 71.08%(使用通用词典)和 69.23%。
Recent progress has been made on developing a unified framework for joint text detection and recognition in natural images, but existing joint models were mostly built on two-stage framework by involving ROI pooling, which can degrade the performance on recognition task. In this work, we propose convolutional character networks, referred as CharNet, which is an one-stage model that can process two tasks simultaneously in one pass. CharNet directly outputs bounding boxes of words and characters, with corresponding character labels. We utilize character as basic element, allowing us to overcome the main difficulty of existing approaches that attempted to optimize text detection jointly with a RNN-based recognition branch. In addition, we develop an iterative character detection approach able to transform the ability of character detection learned from synthetic data to real-world images. These technical improvements result in a simple, compact, yet powerful one-stage model that works reliably on multi-orientation and curved text. We evaluate CharNet on three standard benchmarks, where it consistently outperforms the state-of-the-art approaches [25, 24] by a large margin, e.g., with improvements of 65.33%->71.08% (with generic lexicon) on ICDAR 2015, and 54.0%->69.23% on Total-Text, on end-to-end text recognition. Code is available at: https://github.com/MalongTech/research-charnet.
研究动机与目标
- 解决两阶段框架在联合文本检测与识别中的局限性,特别是受 ROI 池化和基于 RNN 的识别导致的性能下降问题。
- 克服两阶段模型中联合优化基于 RNN 的识别与检测的困难,此类方法通常需要复杂的训练方案和大量数据。
- 开发一种统一的单阶段架构,直接输出单词和字符的边界框及其对应标签,提升训练效率与性能。
- 通过迭代检测策略,实现从合成数据到真实图像的字符检测有效迁移,增强在曲线文本与多方向文本上的鲁棒性。
- 构建一个紧凑轻量的模型,无需依赖词典即可稳定运行,适用于真实场景部署。
提出的方法
- 提出一种单阶段全卷积神经网络(CharNet),在一次前向传播中联合执行文本实例检测与字符识别。
- 引入基于轻量级 CNN 的字符级识别分支,替代 RNN,简化训练过程并降低模型复杂度。
- 以字符作为检测与识别的基本单位,提升在中文等语言中的泛化能力,并改善曲线或多方向文本的性能。
- 采用迭代字符检测策略,实现从合成数据到真实图像的知识迁移,增强领域泛化能力。
- 应用多尺度推理以提升检测与识别精度,尤其在具有挑战性的文本实例上表现更优。
- 将字符识别分支无缝集成至标准文本检测框架(如基于 ResNet 或 Hourglass 主干网络),支持端到端训练。
实验结果
研究问题
- RQ1基于 CNN 的单阶段模型是否能在端到端文本检测与识别任务中超越现有两阶段 RNN 集成框架?
- RQ2与单词相比,使用字符作为基本单位是否能带来更好的泛化能力,特别是在中文和曲线文本等场景中?
- RQ3在与检测联合训练时,基于轻量级 CNN 的字符识别分支是否能超越基于 RNN 的替代方案,同时降低模型复杂度?
- RQ4通过迭代优化,能否有效实现从合成数据训练的字符检测模型向真实图像的迁移?
- RQ5与最先进方法相比,该方法在包含复杂文本(如曲线或多方向文本)的基准测试中表现如何?
主要发现
- 在 ICDAR 2015 上,CharNet 实现了 71.08% 的新最先进端到端识别 F-measure(使用通用词典),相比之前工作的 65.33% 显著提升。
- 在 Total-Text 上,CharNet 实现了 69.23% 的端到端识别 F-measure,较之前最佳方法提升 15.2%,在曲线文本上表现强劲。
- 采用 Hourglass-88 主干网络与多尺度推理时,CharNet 在 ICDAR 2015 上创下单尺度最先进性能,全面超越 Mask TextSpotter 和 FOTS。
- 在不使用任何词典的情况下,CharNet 实现了 60.72% 的端到端识别 F-measure,与使用通用词典的 FOTS 表现相当,展现出强大的零样本泛化能力。
- 在相同主干网络(Hourglass-57)下,尽管识别分支仅含 1.19M 参数,远低于 FOTS 的 6.31M,CharNet 在 ICDAR 2015 上仍比 FOTS 提升 6.12% 的 F-measure(使用通用词典)。
- 在 ICDAR 2017 MLT 上,通过多尺度推理,CharNet 的文本检测 F-measure 达到 86.5%,显著超越此前最先进方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。