[论文解读] Masked Vision-Language Transformers for Scene Text Recognition
本文提出掩码视觉-语言变换器(MVLT),一种两阶段场景文本识别(STR)模型,通过视觉变换器编码器和多模态变换器解码器联合学习显式与隐式语言语义。通过采用双重掩码策略进行预训练,以重建视觉块和掩码的文本标记,同时从完全掩码的输入中学习,该模型在多个基准测试中达到最先进性能,在CUTE数据集上相比之前方法最高提升2.1%。
Scene text recognition (STR) enables computers to recognize and read the text in various real-world scenes. Recent STR models benefit from taking linguistic information in addition to visual cues into consideration. We propose a novel Masked Vision-Language Transformers (MVLT) to capture both the explicit and the implicit linguistic information. Our encoder is a Vision Transformer, and our decoder is a multi-modal Transformer. MVLT is trained in two stages: in the first stage, we design a STR-tailored pretraining method based on a masking strategy; in the second stage, we fine-tune our model and adopt an iterative correction method to improve the performance. MVLT attains superior results compared to state-of-the-art STR models on several benchmarks. Our code and model are available at https://github.com/onealwj/MVLT.
研究动机与目标
- 通过将语言语义整合到视觉模型中,解决在光照不足、遮挡和形变等恶劣条件下的场景文本识别(STR)挑战。
- 克服现有语言感知STR模型仅依赖显式语言模型或隐式视觉线索但无法同时利用两者的局限性。
- 开发统一框架,在预训练过程中同时捕捉显式(词级)和隐式(上下文)语言知识。
- 通过在预训练中利用未标注的真实世界数据,并在微调中采用迭代修正,提升实际应用能力。
提出的方法
- 提出两阶段训练流程:(1) 采用新颖的掩码策略进行预训练,以学习视觉与语言语义;(2) 通过迭代修正进行微调。
- 使用视觉变换器(ViT)作为编码器,从图像块中提取视觉特征。
- 设计一个多模态变换器解码器,包含两个子解码器:一个掩码并预测字符级标记(显式语义),另一个完全掩码文本以仅从视觉线索中学习隐式语义。
- 在预训练阶段共享两个子解码器的参数,以提升效率并增强特征对齐。
- 引入受MAE启发的掩码预训练目标:掩码视觉块和文本标记并进行重建,联合优化视觉与文本损失。
- 在微调阶段应用迭代修正:模型通过多轮前向传播,利用图像和先前预测结果作为输入,逐步优化预测。
实验结果
研究问题
- RQ1联合学习显式与隐式语言语义是否能提升在复杂真实场景下的场景文本识别性能?
- RQ2采用双重掩码策略(同时掩码视觉块和文本标记)是否能增强模型的泛化能力与鲁棒性?
- RQ3在实际场景中,利用未标注的真实世界数据在多大程度上能提升STR性能?
- RQ4在推理阶段采用迭代修正在多大程度上能提升识别准确率,特别是在不规则或退化文本上?
- RQ5从完全掩码的文本输入中学习(即隐式语义)是否比依赖显式词级线索更具优势?
主要发现
- MVLT在所有评估基准上均达到最先进性能,在SVT、IIIT、IC15、SVTP和CUTE上的表现分别优于ABINet 1.2%、0.6%、1.2%、1.6%和2.1%。
- MVLT*(在预训练中使用未标注的真实世界数据)进一步提升了性能,尤其在不规则文本上表现更优,表明其具备更强的真实世界鲁棒性。
- 消融实验证实,同时学习显式与隐式语义至关重要:移除任一成分均导致准确率下降,其中隐式学习的贡献更为显著。
- 迭代修正显著提升性能,尤其在训练中使用显式文本监督时效果更明显。
- 预训练阶段使模型能够重建视觉块和掩码的文本标记,表明其学习到了有意义的视觉-语言表示。
- 可视化结果表明,微调后模型能有效处理遮挡、模糊、形变及复杂字体的文本,显示出强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。