[论文解读] Visual-Semantic Transformer for Scene Text Recognition
本文提出视觉-语义变换器(VST),一种新颖的端到端场景文本识别模型,通过权重共享的视觉-语义对齐模块与多头自注意力交互,联合学习视觉与语义特征。通过基于变换器的交互模块显式提取并融合语义信息与视觉特征,VST在七个公开基准中的四个上达到最先进性能,优于先前方法,且推理速度更快,无需依赖外部语言模型。
Modeling semantic information is helpful for scene text recognition. In this work, we propose to model semantic and visual information jointly with a Visual-Semantic Transformer (VST). The VST first explicitly extracts primary semantic information from visual feature maps with a transformer module and a primary visual-semantic alignment module. The semantic information is then joined with the visual feature maps (viewed as a sequence) to form a pseudo multi-domain sequence combining visual and semantic information, which is subsequently fed into an transformer-based interaction module to enable learning of interactions between visual and semantic features. In this way, the visual features can be enhanced by the semantic information and vice versus. The enhanced version of visual features are further decoded by a secondary visual-semantic alignment module which shares weights with the primary one. Finally, the decoded visual features and the enhanced semantic features are jointly processed by the third transformer module obtaining the final text prediction. Experiments on seven public benchmarks including regular/ irregular text recognition datasets verifies the effectiveness our proposed model, reaching state of the art on four of the seven benchmarks.
研究动机与目标
- 解决在复杂、退化或不规则条件下仅依赖视觉线索不足以识别场景文本的挑战。
- 通过显式建模语义上下文来提升识别准确率,且不依赖外部语言模型或词典。
- 通过统一的、端到端可训练的变换器架构实现有效的视觉-语义特征交互。
- 与基于CTC或自回归模型相比,实现非自回归、并行解码以获得更快的推理速度。
提出的方法
- 模型使用卷积神经网络(ConvNet)从裁剪的场景图像中提取初始视觉特征。
- 主视觉-语义对齐模块通过基于变换器的模块从视觉特征图中提取语义特征。
- 将语义特征与视觉特征拼接为伪多域序列,并输入变换器交互模块,以实现跨模态注意力与特征增强。
- 第二个视觉-语义对齐模块与主模块共享权重,用于解码增强后的视觉特征。
- 最终的增强视觉特征与语义特征由第三个变换器模块与Softmax层联合处理,实现端到端文本预测。
- 模型采用在线数据增强,并在多数据集混合(ST, MJ, SA)上使用类别平衡采样进行训练,优化器为Adam。
实验结果
研究问题
- RQ1在低质量或不规则文本场景下,显式学习语义特征是否能提升场景文本识别性能?
- RQ2通过多头自注意力实现的视觉-语义交互,在增强视觉与语义表征方面有多有效?
- RQ3统一的非自回归变换器模型是否能在速度与准确率上超越自回归或基于CTC的模型?
- RQ4视觉-语义对齐模块之间的权重共享是否能提升特征对齐与泛化能力?
- RQ5与依赖外部预训练语言模型的最先进模型相比,所提方法表现如何?
主要发现
- VST-B与VST-F在七个公开基准中的四个上达到最先进性能,包括在IC03(+0.8%)与CUTE(+2.8%)上的显著提升。
- 该模型在性能上优于近期使用复杂预训练语言模型的最先进方法,且推理速度约快三倍。
- 消融实验确认,每个模块——尤其是视觉-语义对齐与交互模块——对性能提升有显著贡献。
- 注意力热力图可视化表明,交互模块能有效聚焦于与预测字符相对应的相关空间区域。
- 在具有挑战性的不规则与扭曲文本上,模型展现出强大的泛化能力,如图5所示的成功案例可视化所示。
- 添加模块带来的性能增益具有一致性,每个增量组件均提升准确率,验证了模块化设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。