[论文解读] Multimodal Semi-Supervised Learning for Text Recognition
本文提出SemiMTR,一种新颖的用于场景文本识别的多模态自监督学习框架,通过在统一的三阶段训练流程中整合对比学习与字符级一致性正则化。通过联合使用标注和未标注数据对视觉主干网络进行预训练,并利用弱增强和强增强视图生成的伪标签实施自蒸馏,SemiMTR在常见基准上将词错误率降低14%,在非常见基准上降低28%,超越了仅使用合成数据的基线模型。
Until recently, the number of public real-world text images was insufficient for training scene text recognizers. Therefore, most modern training methods rely on synthetic data and operate in a fully supervised manner. Nevertheless, the amount of public real-world text images has increased significantly lately, including a great deal of unlabeled data. Leveraging these resources requires semi-supervised approaches; however, the few existing methods do not account for vision-language multimodality structure and therefore suboptimal for state-of-the-art multimodal architectures. To bridge this gap, we present semi-supervised learning for multimodal text recognizers (SemiMTR) that leverages unlabeled data at each modality training phase. Notably, our method refrains from extra training stages and maintains the current three-stage multimodal training procedure. Our algorithm starts by pretraining the vision model through a single-stage training that unifies self-supervised learning with supervised training. More specifically, we extend an existing visual representation learning algorithm and propose the first contrastive-based method for scene text recognition. After pretraining the language model on a text corpus, we fine-tune the entire network via a sequential, character-level, consistency regularization between weakly and strongly augmented views of text images. In a novel setup, consistency is enforced on each modality separately. Extensive experiments validate that our method outperforms the current training schemes and achieves state-of-the-art results on multiple scene text recognition benchmarks.
研究动机与目标
- 为解决在场景文本识别中,日益增长的公开真实世界文本图像数据集未被充分利用的问题,尤其是在自监督设置下。
- 开发一种方法,有效利用未标注的真实世界数据,同时与现代多模态架构(如ABINet)保持兼容。
- 通过对比学习与一致性正则化引入未标注数据,使性能超越完全依赖合成数据训练的模型。
- 证明通过自监督学习有效利用真实世界数据,可使性能超越仅使用合成数据的模型。
提出的方法
- 提出一种统一的一阶段视觉模型预训练方法,结合监督交叉熵损失与对比学习目标,实现自监督与监督学习的联合优化。
- 适配并扩展SeqCLR——一种原本用于手写文本的序列到序列对比方法——通过使用鲁棒的Transformer主干网络和更强的色彩-纹理增强,将其应用于场景文本识别。
- 引入一种顺序的、基于字符级别的统一性正则化方法,其中每个模态(视觉、语言、融合)作为其自身的教师,为强增强视图生成伪标签以进行自训练。
- 在统一性损失中使用梯度截断和硬独热标签,以稳定训练并提升性能,同时以交叉熵作为核心损失函数。
- 保持ABINet的标准三阶段训练流程(视觉预训练、语言预训练、微调),未增加额外阶段或重训练步骤。
- 采用模态特定的伪标签生成策略,即每个模态独立生成其自身的伪标签用于训练,其中最有效的配置为各模态自我蒸馏。
实验结果
研究问题
- RQ1在存在复杂背景和多样化变化的情况下,能否成功将对比学习应用于真实世界图像的场景文本识别?
- RQ2将对比学习与监督学习结合的统一预训练阶段,是否能相比分离的预训练与微调流程,提升视觉模型的表征能力?
- RQ3在多模态文本识别中,模态特定的伪标签蒸馏是否比跨模态蒸馏更有效?
- RQ4对每个模态分别应用基于字符级别的统一性正则化,是否能带来自监督场景文本识别性能的提升?
- RQ5通过该方法利用未标注的真实世界数据,是否能超越仅使用合成数据训练的性能?
主要发现
- SemiMTR在仅使用真实世界数据训练的情况下,在常见场景文本基准上实现14%的词错误率相对降低,在非常见基准上实现28%的降低,超越了仅使用合成数据的基线模型。
- 结合对比学习与监督学习的统一预训练阶段优于标准的两阶段方法,在常见基准上实现1.3%的准确率绝对提升。
- 最佳的一致性正则化配置采用交叉熵损失、硬独热标签、梯度截断且无阈值化处理,在常见基准上达到92.4%的准确率。
- 自蒸馏(即各模态自我教学)带来最高性能,视觉-语言-融合模型在常见基准上达到92.4%准确率,在非常见基准上达到65.2%。
- 该方法在13个场景文本识别基准中的12个上实现了最先进性能,证明其在多样化数据集上的广泛有效性。
- 更强的色彩-纹理增强显著提升了在文本在野外图像上的表征学习能力,相比原始SeqCLR增强流程,准确率提升1.5%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。