[论文解读] AutoSTR: Efficient Backbone Search for Scene Text Recognition
AutoSTR 提出了一种用于场景文本识别的、数据相关的主干网络搜索框架,采用一种新颖的两步神经架构搜索(NAS)算法,将操作与下采样路径的优化解耦。通过设计一个领域特定的搜索空间并引入 FLOPS 正则化,AutoSTR 发现了高效且高性能的主干网络,在标准基准测试中显著减少了 FLOPS 和参数量的同时,性能超越了当前最先进方法。
Scene text recognition (STR) is very challenging due to the diversity of text instances and the complexity of scenes. The community has paid increasing attention to boost the performance by improving the pre-processing image module, like rectification and deblurring, or the sequence translator. However, another critical module, i.e., the feature sequence extractor, has not been extensively explored. In this work, inspired by the success of neural architecture search (NAS), which can identify better architectures than human-designed ones, we propose automated STR (AutoSTR) to search data-dependent backbones to boost text recognition performance. First, we design a domain-specific search space for STR, which contains both choices on operations and constraints on the downsampling path. Then, we propose a two-step search algorithm, which decouples operations and downsampling path, for an efficient search in the given space. Experiments demonstrate that, by searching data-dependent backbones, AutoSTR can outperform the state-of-the-art approaches on standard benchmarks with much fewer FLOPS and model parameters.
研究动机与目标
- 为解决当前场景文本识别(STR)中缺乏专用、数据相关的主干网络设计的问题,该问题目前依赖于其他任务的预训练主干网络。
- 开发一个包含操作选择与空间下采样路径约束的领域特定搜索空间,以适配 STR 任务。
- 设计一种高效的两步 NAS 算法,将操作与下采样路径搜索解耦,克服现有 NAS 方法在路径约束搜索空间中的局限性。
- 通过在搜索过程中引入 FLOPS 正则化,平衡模型准确率与效率。
- 证明经 NAS 优化的主干网络可在降低计算成本的前提下实现最先进的 STR 性能。
提出的方法
- 提出一个领域特定的搜索空间,包含卷积操作选择(如 3×3 深度可分离卷积、MBConv)以及对下采样路径的显式约束。
- 引入一种两步搜索算法:首先优化下采样路径,其次在已学习路径的基础上优化操作。
- 通过解耦搜索问题,高效处理空间路径约束,而这是现有 NAS 方法难以有效应对的。
- 在目标函数中引入 FLOPS 作为正则化项,以平衡准确率与模型复杂度。
- 采用可微搜索策略并结合参数共享机制,高效评估搜索空间中的架构。
- 在标准 STR 基准上从零开始训练最终搜索到的架构,以验证其性能。
实验结果
研究问题
- RQ1通过 NAS 搜索得到的数据相关主干网络是否能显著提升场景文本识别的准确率,相比固定主干网络(如 ResNet 或 VGG)?
- RQ2将操作与下采样路径搜索解耦,对 STR 中 NAS 的效率与效果有何影响?
- RQ3在搜索过程中引入 FLOPS 正则化,能在多大程度上降低模型复杂度而不损失准确率?
- RQ4能否有效复用为图像分类任务设计的 NAS 架构(如 DARTS、AutoDeepLab)于场景文本识别任务?
- RQ5下采样路径的选择是否显著影响最终搜索架构的性能?
主要发现
- AutoSTR 在所有标准 STR 基准测试(IIIT5K、SVT、IC13、IC15、SVTP)中均达到 SOTA 准确率,IIIT5K 上达到 94.7% 的准确率,较基线提升 0.2%。
- 与基线相比,所搜索的主干网络将 FLOPS 减少 53%(从 319M 降至 149M),参数量减少 65%(从 3.82M 降至 1.32M),同时提升准确率。
- 两步搜索算法将搜索成本降低至 2.2×4 GPU 天,显著快于随机搜索(15×4 GPU 天),且性能更优。
- 直接复用为图像分类任务设计的 NAS 架构(如 DARTS、AutoDeepLab)在 STR 任务中表现显著更差(如 IIIT5K 上准确率为 90.6%),证明领域特定搜索的必要性。
- ABABB 下采样路径策略在 IIIT5K 上实现 94.7% 的准确率,优于 AABBB(93.9%),证实路径设计的重要性。
- 当正则化系数 β=0.6 时,取得最佳平衡,实现 94.7% 准确率,同时仅需 256M FLOPS 和 2.36M 参数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。