Skip to main content
QUICK REVIEW

[论文解读] CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model

Shuai Zhao, Ruijie Quan|arXiv (Cornell University)|May 23, 2023
Multimodal Machine Learning Applications参考文献 98被引用 6
一句话总结

CLIP4STR 提出了一种简单但高效的场景文本识别(STR)框架,利用 CLIP 的预训练视觉-语言模型作为强大的主干网络。它采用双分支架构,其中视觉分支负责初始预测,跨模态分支通过注意力机制实现语义精炼,从而在 11 个 STR 基准测试中实现最先进性能,包括具有挑战性的不规则文本场景。

ABSTRACT

Pre-trained vision-language models~(VLMs) are the de-facto foundation models for various downstream tasks. However, scene text recognition methods still prefer backbones pre-trained on a single modality, namely, the visual modality, despite the potential of VLMs to serve as powerful scene text readers. For example, CLIP can robustly identify regular (horizontal) and irregular (rotated, curved, blurred, or occluded) text in images. With such merits, we transform CLIP into a scene text reader and introduce CLIP4STR, a simple yet effective STR method built upon image and text encoders of CLIP. It has two encoder-decoder branches: a visual branch and a cross-modal branch. The visual branch provides an initial prediction based on the visual feature, and the cross-modal branch refines this prediction by addressing the discrepancy between the visual feature and text semantics. To fully leverage the capabilities of both branches, we design a dual predict-and-refine decoding scheme for inference. We scale CLIP4STR in terms of the model size, pre-training data, and training data, achieving state-of-the-art performance on 13 STR benchmarks. Additionally, a comprehensive empirical study is provided to enhance the understanding of the adaptation of CLIP to STR. Our method establishes a simple yet strong baseline for future STR research with VLMs.

研究动机与目标

  • 探究 CLIP(一种在图像-文本对上预训练的视觉-语言模型)是否可在不微调的情况下,作为场景文本识别(STR)的强大主干网络,尽管该领域长期依赖单模态预训练。
  • 解决 STR 研究中视觉-语言模型(VLMs)被低估的问题,尽管其在复杂、不规则场景中具备强大的文本感知能力。
  • 为未来 STR 研究建立一个简单但强大的基线,利用视觉-语言预训练技术,尤其针对旋转、弯曲、模糊和遮挡等具有挑战性的文本变化。
  • 通过实证研究分析 CLIP 如何适应 STR 任务,并理解其在不规则文本上表现优异的内在机制。

提出的方法

  • CLIP4STR 采用双编码器-解码器架构:视觉分支使用 CLIP 的图像编码器和文本编码器进行初始预测;跨模态分支通过将视觉特征与文本语义对齐,实现预测的语义精炼。
  • 视觉分支利用图像编码器和采用置换序列建模的 Transformer 解码器,生成初始序列预测,以建模任意顺序下的字符依赖关系。
  • 跨模态分支充当语义感知拼写检查器,通过视觉特征与文本嵌入之间的交叉注意力机制,纠正由视觉模糊引起的错误。
  • 设计了一种双阶段预测-精炼解码策略用于推理:视觉分支首先提供预测结果,随后由跨模态分支通过上下文感知解码策略迭代精炼该结果。
  • 推理过程中公式 (9) 用来自视觉分支预测的直接上下文注入替代迭代式跨模态解码,显著降低计算量,仅带来可忽略的精度损失。
  • 该方法利用 CLIP 的预训练图像编码器和文本编码器,未对视觉-语言对齐头进行微调,从而保留了模型的零样本泛化能力。

实验结果

研究问题

  • RQ1CLIP 在图像-文本对上预训练后,是否可在不微调的情况下有效作为场景文本识别的主干网络?
  • RQ2与单模态模型相比,CLIP 的视觉-语言预训练如何提升对不规则文本(如旋转、弯曲、模糊或遮挡)的鲁棒识别能力?
  • RQ3跨模态分支在预测精炼中的贡献是什么?其在处理视觉模糊方面与视觉分支相比表现如何?
  • RQ4使用更大的 CLIP 变体(如 ViT-L)和多轮精炼迭代时,推理速度与精度之间的权衡如何?
  • RQ5在经过修正标注的清洗基准上,CLIP4STR 的表现如何?其在数据修正后是否仍能保持最先进性能?

主要发现

  • CLIP4STR 在 11 个 STR 基准测试中实现最先进性能,包括 IC15、SVTP、CUTE 和 HOST,在标准评估下 IC15 达到 94.1% 的准确率,CUTE 达到 99.3%。
  • 与仅使用视觉分支相比,跨模态分支可将准确率提升最高达 1.1%,证明其在纠正视觉模糊和语义不匹配方面的有效性。
  • 使用 ViT-L 作为主干网络可将 9 个基准的平均准确率提升至 91.9%(见表 VIII),但单样本在 A100 GPU 上的推理时间增加至 6.52ms。
  • 双阶段解码策略在一次精炼迭代时达到最佳权衡,进一步增加迭代次数不会带来额外准确率增益。
  • 在清洗后的基准上,CLIP4STR 仍保持最先进结果,IIIT5K 达到 99.4%,CUTE 达到 99.0%,证实其在真实标注修正后仍具备强鲁棒性。
  • 掩蔽填空解码变体将推理时间降低至 3.41ms(ViT-B,一次迭代),同时保持高准确率,显示出在实时应用中的实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。