Skip to main content
QUICK REVIEW

[论文解读] MixNet: Toward Accurate Detection of Challenging Scene Text in the Wild

Yuxiang Zeng, Jun-Wei Hsieh|arXiv (Cornell University)|Aug 23, 2023
Handwritten Text Recognition Techniques被引用 5
一句话总结

MixNet 提出了一种混合 CNN-Transformer 架构,用于在具有挑战性的现实世界条件下准确检测小尺寸、弯曲及多方向的场景文本。通过结合用于高分辨率特征提取的特征混洗网络(FSNet)和建模文本中心线的中心 Transformer 模块(CTBlock),MixNet 在多个场景文本检测基准上实现了最先进性能,包括在 Total-Text 上达到 90.5% 的 F1 分数,在 ArT 上达到 79.7%。

ABSTRACT

Detecting small scene text instances in the wild is particularly challenging, where the influence of irregular positions and nonideal lighting often leads to detection errors. We present MixNet, a hybrid architecture that combines the strengths of CNNs and Transformers, capable of accurately detecting small text from challenging natural scenes, regardless of the orientations, styles, and lighting conditions. MixNet incorporates two key modules: (1) the Feature Shuffle Network (FSNet) to serve as the backbone and (2) the Central Transformer Block (CTBlock) to exploit the 1D manifold constraint of the scene text. We first introduce a novel feature shuffling strategy in FSNet to facilitate the exchange of features across multiple scales, generating high-resolution features superior to popular ResNet and HRNet. The FSNet backbone has achieved significant improvements over many existing text detection methods, including PAN, DB, and FAST. Then we design a complementary CTBlock to leverage center line based features similar to the medial axis of text regions and show that it can outperform contour-based approaches in challenging cases when small scene texts appear closely. Extensive experimental results show that MixNet, which mixes FSNet with CTBlock, achieves state-of-the-art results on multiple scene text detection datasets.

研究动机与目标

  • 解决在光照不规则和噪声干扰的现实环境中检测小尺寸、弯曲及多方向场景文本的挑战。
  • 克服标准 CNN 主干网络(如 ResNet 和 HRNet)在保留高分辨率特征和减少噪声干扰方面的局限性。
  • 通过建模超越轮廓方法的全局几何结构,提升任意形状文本的检测精度。
  • 设计一种混合架构,充分发挥 CNN 在局部特征提取方面的优势与 Transformer 在全局空间推理方面的能力。

提出的方法

  • 提出一种特征混洗网络(FSNet),在卷积特征提取过程中实现低分辨率与高分辨率特征图之间的特征交换。
  • 在 FSNet 中引入一种新颖的特征混洗策略,以加深高分辨率特征学习并提升特征表示质量。
  • 设计一种中心 Transformer 模块(CTBlock),通过沿文本中心线和轮廓采样特征来建模全局几何布局。
  • 利用后处理的热力图提取粗略的文本轮廓,从中采样中心线特征并输入 Transformer 以实现边界精细化。
  • 对初始轮廓应用学习到的顶点偏移量,生成精确且细化的文本掩码。
  • 将 FSNet 作为主干网络与 CTBlock 结合,实现端到端的场景文本检测,支持尺度不变性和抗噪声特征学习。

实验结果

研究问题

  • RQ1如何通过深度神经网络架构在提升小尺寸场景文本检测的高分辨率特征表示能力的同时降低对噪声的敏感性?
  • RQ2与基于轮廓的方法相比,建模文本中心线对密集排列或弯曲文本区域检测精度的影响如何?
  • RQ3混合 CNN-Transformer 架构是否能在任意形状场景文本检测基准上超越现有最先进方法?
  • RQ4与 ResNet 和 HRNet 等标准主干网络相比,FSNet 中提出的特征混洗机制在特征质量与检测性能方面表现如何?

主要发现

  • 在 Total-Text 数据集上,MixNet 实现了 90.5% 的新 SOTA F1 分数,较之前方法提升 1.5 个百分点。
  • 在 ArT 数据集上,MixNet 实现 79.7% 的 F1 分数,较 TextFuseNet 提升 3.9% 的召回率和 1.1% 的 F1 分数。
  • 在 MSRA-TD500 上,MixNet 实现 89.4% 的 F-measure,较现有方法在多方向文本检测任务上提升 2.1%。
  • 当将 FSNet 主干网络替换基线模型中的 ResNet50 时,检测 F1 分数提升 2.1%。
  • 在 FSNet 主干网络基础上添加 CTBlock 组件后,性能进一步提升 0.5% 的 F1 分数。
  • 定性分析表明,MixNet 在检测小尺寸、弯曲及密集排列文本方面表现出一致的优越性,其效果在多个不同数据集的示例中均得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。