[论文解读] Scene Text Recognition with Permuted Autoregressive Sequence Models
PARSeq 提出了一种统一的、置换自回归序列模型,用于场景文本识别,通过共享权重和双向上下文联合处理图像与语言特征,实现了最先进精度(合成数据上为91.9%,真实数据上为96.0%),同时提升了效率,增强了对任意文本方向的鲁棒性,并通过消除对外部语言模型的依赖(避免了对正确预测进行易错校正)降低了错误风险。
Context-aware STR methods typically use internal autoregressive (AR) language models (LM). Inherent limitations of AR models motivated two-stage methods which employ an external LM. The conditional independence of the external LM on the input image may cause it to erroneously rectify correct predictions, leading to significant inefficiencies. Our method, PARSeq, learns an ensemble of internal AR LMs with shared weights using Permutation Language Modeling. It unifies context-free non-AR and context-aware AR inference, and iterative refinement using bidirectional context. Using synthetic training data, PARSeq achieves state-of-the-art (SOTA) results in STR benchmarks (91.9% accuracy) and more challenging datasets. It establishes new SOTA results (96.0% accuracy) when trained on real data. PARSeq is optimal on accuracy vs parameter count, FLOPS, and latency because of its simple, unified structure and parallel token processing. Due to its extensive use of attention, it is robust on arbitrarily-oriented text which is common in real-world images. Code, pretrained weights, and data are available at: https://github.com/baudm/parseq.
研究动机与目标
- 为解决自回归语言模型在场景文本识别中的局限性,包括单向上下文偏差以及与外部语言模型结合的两阶段推理效率低下问题。
- 将上下文无关的非自回归推理与上下文感知的自回归推理统一为单一、高效的模型架构。
- 提升对真实图像中常见任意方向和扭曲文本的鲁棒性。
- 通过联合图像-上下文建模,消除外部语言模型对外部校正正确预测的错误风险。
- 通过并行标记处理和高效注意力机制,实现在极低计算开销和低延迟下的最先进性能。
提出的方法
- PARSeq 使用置换语言建模,通过共享权重学习一组内部自回归语言模型,实现在单次前向传播中实现双向上下文学习。
- 采用基于 Transformer 的架构,结合跨模态注意力机制,联合关注视觉特征和预测标记,支持预测结果的迭代优化。
- 以统一方式执行初始解码和迭代优化,避免了对独立的上下文无关与上下文感知模型的需求。
- 通过使用置换自回归建模,PARSeq 实现了并行生成标记,同时保持了强自回归归纳偏置,相比标准自回归解码显著降低了延迟。
- 该方法利用自注意力机制建模长距离依赖关系,由于其基于注意力的特征融合机制,对文本方向变化具有鲁棒性。
- 在合成数据上进行训练以提升泛化能力,并在真实数据上进行微调,以实现在真实世界基准上的高精度。
实验结果
研究问题
- RQ1统一的模型架构能否在提升准确率和效率的同时,替代场景文本识别中上下文无关与上下文感知模型的两阶段流水线?
- RQ2与标准自回归模型相比,使用共享权重的置换自回归建模在处理任意方向和扭曲文本时,其鲁棒性如何提升?
- RQ3与外部语言模型相比,内部语言建模在多大程度上能降低对正确预测进行错误校正的风险?
- RQ4通过置换建模在单次统一推理过程中引入双向上下文,其性能提升程度如何?
- RQ5在合成数据上训练并在真实数据上微调的模型,能否在真实世界场景文本基准上实现最先进性能?
主要发现
- PARSeq 在合成数据基准上实现了 91.9% 的新最先进精度,优于先前方法。
- 在真实世界数据上,PARSeq 达到 96.0% 的精度,在 Uber-Text 和 COCO-Text 等多个基准上建立了新的 SOTA 记录。
- PARSeq 在 Uber-Text 数据集上正确识别了所有样本,包括高度旋转和垂直方向的文本,而其他模型在此类样本上失败。
- 在定性比较中,PARSeq 是唯一能正确识别具有挑战性的样本(如 'Chevron'(部分遮挡)和 'GUNNESS'(低分辨率、遮挡))的模型。
- 在曲线和手写体文本(如手写体字体的 'Creative')上,PARSeq 表现优于 ABINet 和 ViTSTR-S,后者在这些样本上无法正确识别字符串。
- 由于其统一且可并行化的架构以及高效的注意力机制,该模型在准确率、参数量、FLOPS 和延迟之间实现了最佳权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。