[论文解读] Primitive Representation Learning for Scene Text Recognition
本文提出原始表征学习网络(PREN)及其二维版本PREN2D,用于场景文本识别。通过将特征图建模为无向图,利用池化与加权聚合器学习稳定且内在的原始表征,再通过图卷积网络将表征转化为视觉文本表征。该方法在英文与中文场景文本基准上均取得最先进性能,其中PREN2D通过减少错位现象并提升准确率,优于现有注意力机制模型。
Scene text recognition is a challenging task due to diverse variations of text instances in natural scene images. Conventional methods based on CNN-RNN-CTC or encoder-decoder with attention mechanism may not fully investigate stable and efficient feature representations for multi-oriented scene texts. In this paper, we propose a primitive representation learning method that aims to exploit intrinsic representations of scene text images. We model elements in feature maps as the nodes of an undirected graph. A pooling aggregator and a weighted aggregator are proposed to learn primitive representations, which are transformed into high-level visual text representations by graph convolutional networks. A Primitive REpresentation learning Network (PREN) is constructed to use the visual text representations for parallel decoding. Furthermore, by integrating visual text representations into an encoder-decoder model with the 2D attention mechanism, we propose a framework called PREN2D to alleviate the misalignment problem in attention-based methods. Experimental results on both English and Chinese scene text recognition tasks demonstrate that PREN keeps a balance between accuracy and efficiency, while PREN2D achieves state-of-the-art performance.
研究动机与目标
- 为解决基于CTC与注意力机制的场景文本识别模型的局限性,特别是CTC中的冗余问题与注意力机制中的错位问题。
- 从场景文本图像中学习对多方向与不规则文本实例具有鲁棒性的稳定且内在的视觉表征。
- 构建一种支持通过原始表征实现并行解码的框架,同时保持与注意力机制模型的兼容性。
- 通过完全基于视觉特征提取的视觉文本表征,缓解二维注意力机制中的错位问题。
提出的方法
- 将CNN特征图中的元素建模为无向图中的节点,以实现全局特征聚合。
- 提出一种池化聚合器,通过共享卷积与全局平均池化,学习在多样化文本实例间共有的结构模式。
- 设计一种加权聚合器,生成样本特定的热力图,以自适应地聚焦于特征图中的显著区域。
- 使用图卷积网络(GCNs)将学习到的原始表征转换为高层视觉文本表征,用于字符级解码。
- 构建PREN以利用视觉文本表征实现并行解码,并将这些表征集成至基于2D注意力的编码器-解码器框架中,形成PREN2D以改善对齐效果。
- 在合成数据上训练6个周期,在真实数据上微调20个周期,通过从水平与垂直文本子集随机采样实现数据增强。
实验结果
研究问题
- RQ1通过全局特征聚合获得的原始表征是否能提升在多方向与不规则文本图像上的场景文本识别鲁棒性?
- RQ2完全基于视觉特征学习的视觉文本表征是否能减少注意力机制中场景文本识别的错位问题?
- RQ3所提出的原始表征学习框架能否有效集成至现有注意力机制模型中以提升性能?
- RQ4所提方法在英文与中文场景文本识别基准上的性能与最先进模型相比如何?
主要发现
- 在多方向中文RCTW数据集上,PREN2D实现85.0%的最先进词准确率,优于Baseline2D(84.5%)与CNN-LSTM-CTC(59.1%)。
- 在英文IIIT5k、SVT、IC03、IC13、IC15、SVTP与CUTE数据集上,PREN2D在所有对比模型中表现最佳,展现出在多样化基准上的强大泛化能力。
- 池化聚合器学习到跨不同文本实例的共享结构模式,表现为相同原始表征在不同输入中产生一致的特征图响应。
- 加权聚合器生成的自适应热力图聚焦于字符边界与中心区域,表明其在显著特征定位上优于池化聚合器。
- 注意力图可视化显示,PREN2D的对齐效果优于Baseline2D,能正确将字母'N'的中心区域与对应字符关联,而Baseline2D将'N'的右半部分错误关联至'I'。
- PREN在中文数据集上实现76.5%的平均词准确率,显著优于CNN-LSTM-CTC(59.1%),证明原始表征学习在处理复杂字符集方面的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。