[论文解读] KISS: Keeping It Simple for Scene Text Recognition
KISS 提出了一种场景文本识别模型,仅使用现成的神经网络组件——两个 ResNet-18 特征提取器、一个空间变换器和一个 Transformer——便实现了最先进或具有竞争力的性能,无需使用如 2D 注意力或图像校正等专用层。该模型在合成数据上从零开始端到端训练,表明简洁性和模块化设计可在场景文本识别中实现高精度。
Over the past few years, several new methods for scene text recognition have been proposed. Most of these methods propose novel building blocks for neural networks. These novel building blocks are specially tailored for the task of scene text recognition and can thus hardly be used in any other tasks. In this paper, we introduce a new model for scene text recognition that only consists of off-the-shelf building blocks for neural networks. Our model (KISS) consists of two ResNet based feature extractors, a spatial transformer, and a transformer. We train our model only on publicly available, synthetic training data and evaluate it on a range of scene text recognition benchmarks, where we reach state-of-the-art or competitive performance, although our model does not use methods like 2D-attention, or image rectification.
研究动机与目标
- 开发一种仅依赖标准、可复用神经网络组件而非特定任务架构的场景文本识别模型。
- 在不使用如 2D 注意力、图像校正或微调等专用技术的情况下,实现最先进或具有竞争力的性能。
- 探究仅由现成组件构建的简单、模块化架构是否能超越或匹配复杂、特定任务的模型。
- 通过消融研究评估模型中各个组件的重要性。
- 证明仅使用公开可用的合成训练数据和端到端训练,即可实现场景文本识别的高性能。
提出的方法
- 该模型使用两个独立的 ResNet-18 特征提取器:一个用于定位,一个用于识别。
- 定位网络预测输入单词图像中感兴趣区域(ROIs)的仿射变换矩阵。
- 空间变换器使用这些矩阵从输入图像中裁剪并归一化 ROIs。
- 裁剪后的 ROIs 输入识别网络,该网络使用 Transformer 预测完整的字符序列。
- 整个系统仅使用词级标注且无需真实边界框,即可实现端到端可训练。
- 该模型在公开可用的合成数据集上从零开始训练,不使用数据增强或微调。
实验结果
研究问题
- RQ1能否仅使用标准、现成的神经网络组件实现最先进水平的场景文本识别性能?
- RQ2在场景文本识别中,是否必须使用如 2D 注意力或图像校正等专用组件才能获得高精度?
- RQ3数据增强和多样化训练数据对模型性能有多重要?
- RQ4各个架构组件(如 Transformer、空间变换器、定位网络)对整体性能的相对贡献如何?
- RQ5在前向传播中不使用标签注入的情况下,基于 Transformer 的定位头是否能有效训练,且是否能提升性能?
主要发现
- KISS 模型在多个标准场景文本识别基准上实现了最先进或具有竞争力的性能,且未使用 2D 注意力或图像校正。
- 将定位网络中的 LSTM 替换为 Transformer 并未提升性能,反而增加了训练时间,表明现阶段收益有限。
- 在识别头中使用 Transformer 显著优于简单 Softmax 分类器,证实了注意力机制在序列到序列建模中的重要性。
- 在识别网络中增加 Transformer 层的数量并未带来更好的结果,表明单层 Transformer 已足够。
- 移除定位网络,直接将裁剪后的 ROIs 输入识别网络,在非聚焦或弯曲文本上性能变差,证实了自适应 ROI 选择的价值。
- 数据增强对某些数据集的性能至关重要,而在其他数据集上影响较小,表明性能对数据集具有敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。