Skip to main content
QUICK REVIEW

[论文解读] FAST: Faster Arbitrarily-Shaped Text Detector with Minimalist Kernel Representation

Zhe Chen, Wang, Jiahao|arXiv (Cornell University)|Nov 3, 2021
Handwritten Text Recognition Techniques参考文献 46被引用 7
一句话总结

FAST 提出了一种基于极简核表示(MKR)和 GPU 并行后处理的实时、高精度任意形状文本检测方法,实现了在 Total-Text 上 152.8 FPS 下 81.6% 的 F-measure,优于以往方法在速度与精度上的表现。该方法采用定制的神经架构搜索(NAS)以生成文本专用主干网络(TextNet),实现高效端到端 GPU 推理,后处理开销极低。

ABSTRACT

We propose an accurate and efficient scene text detection framework, termed FAST (i.e., faster arbitrarily-shaped text detector). Different from recent advanced text detectors that used complicated post-processing and hand-crafted network architectures, resulting in low inference speed, FAST has two new designs. (1) We design a minimalist kernel representation (only has 1-channel output) to model text with arbitrary shape, as well as a GPU-parallel post-processing to efficiently assemble text lines with a negligible time overhead. (2) We search the network architecture tailored for text detection, leading to more powerful features than most networks that are searched for image classification. Benefiting from these two designs, FAST achieves an excellent trade-off between accuracy and efficiency on several challenging datasets, including Total Text, CTW1500, ICDAR 2015, and MSRA-TD500. For example, FAST-T yields 81.6% F-measure at 152 FPS on Total-Text, outperforming the previous fastest method by 1.7 points and 70 FPS in terms of accuracy and speed. With TensorRT optimization, the inference speed can be further accelerated to over 600 FPS. Code and models will be released at https://github.com/czczup/FAST.

研究动机与目标

  • 为解决现有文本检测器中基于 CPU 的后处理效率低下问题,其耗时最高可达推理时间的 30%。
  • 设计一种 GPU 友好的文本表示方式,以支持可并行化的后处理,实现实时推理。
  • 开发一种专为文本检测而非图像分类设计的神经架构搜索(NAS)流程,以发现更高效的轻量化主干网络。
  • 在具有挑战性的任意形状文本基准上,实现检测精度与推理速度之间的更优权衡。

提出的方法

  • 提出一种极简核表示(MKR),将文本行编码为单通道腐蚀区域及其边缘像素,支持在后处理阶段高效进行 GPU 并行文本膨胀操作。
  • 采用 GPU 并行文本膨胀操作,从 MKR 输出中重建完整的文本实例,将后处理时间降至可忽略的开销。
  • 设计专为文本检测定制的 NAS 搜索空间与奖励函数,优化文本感知上下文中的特征质量,而非通用图像分类任务。
  • 通过搜索并部署名为 TextNet 的高效主干网络,其在文本检测任务上的表现优于 ImageNet 预训练或通用目标检测模型。
  • 利用 TensorRT 推理优化进一步加速,实现在 V100 GPU 上批量大小为 8 时超过 600 FPS 的推理速度。

实验结果

研究问题

  • RQ1极简核表示是否能够同时实现高精度与 GPU 并行后处理?
  • RQ2与从图像分类迁移学习相比,专为文本设计的神经架构搜索(NAS)策略是否能显著提升检测性能?
  • RQ3将 GPU 并行后处理管道与定制化主干网络结合,能否在精度与速度上带来显著提升?
  • RQ4在保持任意形状文本基准高 F-measure 的前提下,使用 TensorRT 能将推理速度提升多少?

主要发现

  • FAST-T-448 在 Total-Text 上实现 81.6% F-measure 与 152.8 FPS,相比之前最快方法 PAN-320,F-measure 提升 1.7 个百分点,速度提升 70 FPS。
  • 经 TensorRT 优化后,FAST-T-448 实现 634.7 FPS(批量大小 8),展现出强大的实际部署效率。
  • FAST-B-800 在 Total-Text 上实现 87.5% F-measure 与 46.0 FPS,保持实时推理的同时,在精度与 FLOPs 上显著优于 PSENet-4s(87.5% vs. 79.6%,100.1G vs. 345.9G)。
  • 在 Total-Text 上,FAST-T-512 实现 83.5% F-measure 与 29.5G FLOPs,优于 FLOPs 相近的 DB-R18(82.8% F-measure)。
  • FAST-S-512 实现 84.9% F-measure 与 115.5 FPS,模型参数量仅 9.7M,展现出小模型下的强大性能。
  • NAS 优化的 TextNet 主干网络在特征表达能力上优于未专为该任务设计的 MobileNetV3 或 ResNet18。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。