[论文解读] Multi-Granularity Prediction with Learnable Fusion for Scene Text Recognition
该论文提出 MGP-STR,一种基于视觉 Transformer 的场景文本识别模型,通过引入多粒度预测——整合字符、BPE 和 WordPiece 子词表示——在不使用显式语言模型的情况下提升性能。该模型提出了一种可学习融合策略(LFS),通过测量预测文本与图像特征之间的跨模态相似性,实现了在 IIIT-5K、ICDAR 2015、SVT 和 CUTE 等标准基准上的最先进准确率(94%)。
Due to the enormous technical challenges and wide range of applications, scene text recognition (STR) has been an active research topic in computer vision for years. To tackle this tough problem, numerous innovative methods have been successively proposed, and incorporating linguistic knowledge into STR models has recently become a prominent trend. In this work, we first draw inspiration from the recent progress in Vision Transformer (ViT) to construct a conceptually simple yet functionally powerful vision STR model, which is built upon ViT and a tailored Adaptive Addressing and Aggregation (A$^3$) module. It already outperforms most previous state-of-the-art models for scene text recognition, including both pure vision models and language-augmented methods. To integrate linguistic knowledge, we further propose a Multi-Granularity Prediction strategy to inject information from the language modality into the model in an implicit way, \ie, subword representations (BPE and WordPiece) widely used in NLP are introduced into the output space, in addition to the conventional character level representation, while no independent language model (LM) is adopted. To produce the final recognition results, two strategies for effectively fusing the multi-granularity predictions are devised. The resultant algorithm (termed MGP-STR) is able to push the performance envelope of STR to an even higher level. Specifically, MGP-STR achieves an average recognition accuracy of $94\%$ on standard benchmarks for scene text recognition. Moreover, it also achieves state-of-the-art results on widely-used handwritten benchmarks as well as more challenging scene text datasets, demonstrating the generality of the proposed MGP-STR algorithm. The source code and models will be available at: \url{https://github.com/AlibabaResearch/AdvancedLiterateMachinery/tree/main/OCR/MGP-STR}.
研究动机与目标
- 通过隐式整合语言知识而不依赖独立语言模型,提升场景文本识别(STR)性能。
- 通过引入子词级别表示(BPE 和 WordPiece)以解决仅基于字符的预测局限性,提升对噪声和形变的鲁棒性。
- 设计一种可学习融合机制,基于图像-文本相似性动态结合多粒度预测结果,从而提升最终识别准确率。
- 开发一种基于视觉 Transformer 和自适应注意力模块(A3)的纯视觉 STR 模型,其性能优于现有纯视觉方法与语言增强方法。
- 在多样化的基准数据集上实现最先进性能,包括具有挑战性的真实世界与手写文本数据集,同时避免迭代优化以实现更快推理速度。
提出的方法
- 构建基于视觉 Transformer(ViT)的纯视觉 STR 模型,并引入定制化的自适应定位与聚合(A3)模块,以提升特征表示能力。
- 通过扩展输出空间以包含字符级、BPE 级和 WordPiece 级预测,引入多粒度预测(MGP),实现在无外部语言模型情况下的多任务学习。
- 采用基于置信度的融合策略(CFS),利用各分支的置信度分数进行融合,提供一种简单而有效的融合机制。
- 提出可学习融合策略(LFS),通过可训练模块计算预测文本与图像特征之间的跨模态相似性,受 CLIP 启发,实现动态、上下文感知的融合。
- 采用端到端训练方式,为字符、BPE 和 WordPiece 预测分别设置独立损失函数,使语言先验通过多任务优化隐式学习。
- 利用 Image A3 模块生成稀疏的、基于注意力的特征图,突出显示显著的文本区域,作为 LFS 中图像-文本匹配的全局池化机制。
实验结果
研究问题
- RQ1在不使用显式语言模型的前提下,结合子词表示(BPE 和 WordPiece)的多粒度预测是否能提升场景文本识别性能?
- RQ2基于图像-文本相似性的可学习融合策略与基于置信度的融合策略相比,在识别准确率与鲁棒性方面表现如何?
- RQ3所提出的 MGP-STR 模型在多样化基准数据集(包括标准、手写及具有挑战性的现实世界场景文本数据集)上的泛化能力如何?
- RQ4MGP-STR 模型因不采用迭代优化,是否在保持最先进准确率的同时实现更快的推理速度,相较于先前方法?
- RQ5通过多粒度预测利用语言的组合特性,是否能进一步提升模型性能?
主要发现
- 采用可学习融合策略(LFS)的 MGP-STR 在标准场景文本基准(包括 IIIT-5K、ICDAR 2015、SVT 和 CUTE)上实现了 94% 的最先进平均识别准确率。
- 该模型在无显式语言模型的情况下,仍优于纯视觉与语言增强型 STR 方法,证明了隐式语言知识整合的有效性。
- 可学习融合策略(LFS)显著优于基于置信度的融合(CFS),表明基于相似性的融合能更准确地对齐预测文本与视觉特征。
- MGP-STR 在手写文本基准(IAM、CVL、RIMES)上也取得最先进结果,表明其对连笔字与低质量文本具有强大泛化能力。
- 该模型在 ArT、COCO-Text 和 Uber-Text 等具有挑战性的数据集上也达到最先进性能,证实其在复杂现实场景下的鲁棒性。
- Image A3 模块生成的注意力图稀疏但聚焦于相关文本区域,表明该模块作为图像-文本匹配的全局池化机制具有显著有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。