Skip to main content
QUICK REVIEW

[论文解读] From Two to One: A New Scene Text Recognizer with Visual Language Modeling Network

Yuxin Wang, Hongtao Xie|arXiv (Cornell University)|Aug 22, 2021
Handwritten Text Recognition Techniques参考文献 46被引用 9
一句话总结

本文提出VisionLAN,一种新颖的场景文本识别器,通过在训练过程中赋予视觉模型内在的语言能力,统一视觉与语言理解。通过使用掩码语言感知模块模拟字符遮挡,并利用视觉推理模块利用上下文信息,VisionLAN在实现39%更快推理速度的同时,达到最先进准确率,无需外部语言模型,实现一步完成、高效且鲁棒的文本识别。

ABSTRACT

In this paper, we abandon the dominant complex language model and rethink the linguistic learning process in the scene text recognition. Different from previous methods considering the visual and linguistic information in two separate structures, we propose a Visual Language Modeling Network (VisionLAN), which views the visual and linguistic information as a union by directly enduing the vision model with language capability. Specially, we introduce the text recognition of character-wise occluded feature maps in the training stage. Such operation guides the vision model to use not only the visual texture of characters, but also the linguistic information in visual context for recognition when the visual cues are confused (e.g. occlusion, noise, etc.). As the linguistic information is acquired along with visual features without the need of extra language model, VisionLAN significantly improves the speed by 39% and adaptively considers the linguistic information to enhance the visual features for accurate recognition. Furthermore, an Occlusion Scene Text (OST) dataset is proposed to evaluate the performance on the case of missing character-wise visual cues. The state of-the-art results on several benchmarks prove our effectiveness. Code and dataset are available at https://github.com/wangyuxin87/VisionLAN.

研究动机与目标

  • 解决现有两阶段场景文本识别方法中视觉与语言信息融合效率低下、融合效果差的问题。
  • 使视觉模型在训练过程中能够自主学习并利用语言上下文,减少对独立语言模型的依赖。
  • 提升在遮挡、噪声和模糊等挑战性条件下识别文本的鲁棒性。
  • 提出一个新的基准数据集OST,用于评估在字符级视觉线索缺失场景下的性能表现。
  • 通过将语言建模直接集成到视觉主干网络中,实现一步完成的识别流程,同时保持高效率与高准确率。

提出的方法

  • 提出视觉语言建模网络(VisionLAN),一种统一架构,使视觉模型在训练过程中能够推理语言上下文。
  • 采用掩码语言感知模块(MLM),基于真实字符索引生成字符级掩码图,模拟训练过程中的视觉遮挡。
  • 使用视觉推理模块(VRM)从被遮挡的视觉特征中预测文本,使模型能够直接在视觉空间中学习上下文语言依赖关系。
  • 在视觉线索退化时,训练视觉模型自适应地利用语言上下文增强特征,推理阶段无需外部语言模型。
  • 利用弱监督互补学习生成合理的掩码图,基于位置与上下文定位缺失的字符级视觉线索。
  • 测试阶段移除MLM模块,仅使用增强特征的视觉模型,实现语言建模的零额外计算开销。

实验结果

研究问题

  • RQ1是否可以训练视觉模型在训练过程中自主学习并利用语言上下文,以提升在视觉退化条件下的识别性能?
  • RQ2与两阶段方法相比,将视觉与语言建模统一于单一网络架构中,是否能降低计算成本并提升准确率?
  • RQ3当字符级视觉特征缺失或受损时,所提方法在文本识别方面的有效性如何?
  • RQ4该模型在长文本及非拉丁文字(如中文)场景下,是否具备良好的泛化能力?
  • RQ5模型在视觉特征空间中端到端学习语言上下文,其性能提升程度如何?

主要发现

  • VisionLAN通过在单一网络中统一视觉与语言信息,相比基线模型平均准确率提升7.3%。
  • 由于无需外部语言模型,与以往两阶段方法相比,推理速度提升39%。
  • 在TRW15长文本中文基准上,VisionLAN准确率达到88.7%,较之前最先进方法(SRN)高出3.2%。
  • 在所提出的遮挡场景文本(OST)数据集中,VisionLAN在处理缺失字符级视觉线索方面表现出更优的鲁棒性。
  • 定性结果表明,VisionLAN能正确识别易混淆字符(如'e'与'f'),并利用语言上下文有效抑制背景干扰。
  • 掩码语言感知模块成功定位字符级视觉线索,并泛化至扭曲及重复字符场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。