[论文解读] TextScanner: Reading Characters in Order for Robust Scene Text Recognition
TextScanner 提出了一种基于双分支、分割的框架,用于实现鲁棒的场景文本识别,该框架将字符分类与几何定位及顺序预测解耦。通过为类别和几何(位置/顺序)分别设置独立分支,并利用逐元素相乘的方式融合预测结果,确保了正确的字符排序,同时减少了注意力漂移和分割阈值错误。在 MLT-17 上,该方法实现了 64.1% 的准确率和 0.75 的归一化编辑距离,优于先前的 SOTA 方法。
Driven by deep learning and the large volume of data, scene text recognition has evolved rapidly in recent years. Formerly, RNN-attention based methods have dominated this field, but suffer from the problem of extit{attention drift} in certain situations. Lately, semantic segmentation based algorithms have proven effective at recognizing text of different forms (horizontal, oriented and curved). However, these methods may produce spurious characters or miss genuine characters, as they rely heavily on a thresholding procedure operated on segmentation maps. To tackle these challenges, we propose in this paper an alternative approach, called TextScanner, for scene text recognition. TextScanner bears three characteristics: (1) Basically, it belongs to the semantic segmentation family, as it generates pixel-wise, multi-channel segmentation maps for character class, position and order; (2) Meanwhile, akin to RNN-attention based methods, it also adopts RNN for context modeling; (3) Moreover, it performs paralleled prediction for character position and class, and ensures that characters are transcripted in correct order. The experiments on standard benchmark datasets demonstrate that TextScanner outperforms the state-of-the-art methods. Moreover, TextScanner shows its superiority in recognizing more difficult text such Chinese transcripts and aligning with target characters.
研究动机与目标
- 解决基于 RNN-注意力机制的场景文本识别模型在推理过程中出现的注意力漂移问题。
- 克服基于语义分割方法中因分割阈值导致的过分割/欠分割问题。
- 提升在具有挑战性的文本(尤其是弯曲、倾斜及中文文本)上的识别鲁棒性。
- 通过显式的顺序监督,在推理阶段确保正确的字符排序。
- 通过分类与几何分支之间的相互监督,提升模型的泛化能力。
提出的方法
- TextScanner 采用双分支架构:一个分支通过多通道分割图预测字符类别概率。
- 第二个分支使用专用的几何图预测字符位置与顺序,其中顺序信息通过不同通道编码。
- 通过将类别图与几何图进行逐元素相乘,形成字符实例,再对每个通道取 argmax 以提取(位置、顺序、类别)。
- 模型在训练过程中引入相互监督机制,使几何监督有助于分类,反之亦然。
- 采用基于 SynthText 的合成数据生成流水线,先在多样化文本布局上进行预训练,再在真实数据上微调。
- 整个框架采用端到端训练,分类任务使用交叉熵损失,定位与顺序预测任务使用 L1 损失。
实验结果
研究问题
- RQ1基于分割的方法是否能在推理过程中有效缓解注意力漂移问题,从而优于基于 RNN-注意力的模型?
- RQ2在几何分支中引入显式顺序监督,是否能减少基于阈值的连通域检测带来的错误?
- RQ3将分类与几何预测解耦,对弯曲或中文等不规则复杂文本的性能有何影响?
- RQ4分类与几何分支之间的相互监督机制,在多大程度上提升了识别准确率?
- RQ5该模型在具有多样化形状与外观的真实世界场景文本上是否具备良好的泛化能力?
主要发现
- 在 MLT-17 基准测试中,TextScanner 实现了 64.1% 的准确率和 0.75 的归一化编辑距离,优于 CRNN(59.2% 准确率,0.68 NED)和 ASTER(57.4% 准确率,0.69 NED)。
- 在 IC13 上,TextScanner 局部化准确率显著更高,62.3% 的预测结果与真实值的归一化距离在 0.1 以内,远超注意力机制模型的表现。
- 消融实验表明,仅使用几何分支即可在 IIIT 上提升 0.6% 准确率,SVT 上提升 0.9%,IC13 上提升 3.1%,证明其有效性。
- 引入顺序图后,IC15 上性能提升 1.4%,SVTP 上提升 2.5%,表明在不规则文本上获得显著增益。
- 相互监督机制提升了泛化能力,尤其在合成数据预训练后使用真实数据微调时表现更优。
- 通过避免依赖阈值处理,TextScanner 有效减少了虚假和缺失字符,该结论得到了在具有挑战性的数据集上定性和定量结果的验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。