[论文解读] Bidirectional Scene Text Recognition with a Single Decoder
本文提出Bi-STET,一种基于单解码器的Transformer架构,用于双向场景文本识别,通过输入级别的方向嵌入来控制解码方向,与双解码器方法相比,在训练迭代次数减少50%且参数更少的情况下实现了最先进性能。
Scene Text Recognition (STR) is the problem of recognizing the correct word or character sequence in a cropped word image. To obtain more robust output sequences, the notion of bidirectional STR has been introduced. So far, bidirectional STRs have been implemented by using two separate decoders; one for left-to-right decoding and one for right-to-left. Having two separate decoders for almost the same task with the same output space is undesirable from a computational and optimization point of view. We introduce the bidirectional Scene Text Transformer (Bi-STET), a novel bidirectional STR method with a single decoder for bidirectional text decoding. With its single decoder, Bi-STET outperforms methods that apply bidirectional decoding by using two separate decoders while also being more efficient than those methods, Furthermore, we achieve or beat state-of-the-art (SOTA) methods on all STR benchmarks with Bi-STET. Finally, we provide analyses and insights into the performance of Bi-STET.
研究动机与目标
- 解决现有双向场景文本识别(STR)方法中使用两个独立解码器分别进行从左到右和从右到左解码所导致的效率低下与冗余问题。
- 通过在输入级别而非架构或算法级别实现任务条件化,探索一种更高效且统一的双向STR架构。
- 在保持或超越标准STR基准最先进性能的同时,提升模型效率并实现参数共享。
- 探究单个Transformer解码器是否能有效学习并利用双向解码,而无需为每种方向设计专用注意力头。
提出的方法
- 提出一种单解码器Transformer架构(Bi-STET),通过在输入序列中添加方向嵌入来控制解码方向(从左到右或从右到左)。
- 利用Transformer的自注意力机制处理序列而无需循环结构,实现全局上下文建模,并消除对特定解码顺序的归纳偏置。
- 通过在输入嵌入中注入可学习的方向标记(例如,'L2R'或'R2L')来对解码方向进行条件化,使一个解码器可同时服务于两种方向。
- 在两种解码方向之间共享所有模型参数,包括注意力头,以提升参数效率并促进多任务学习。
- 采用标准的Transformer编码器-解码器结构,通过交叉注意力实现图像特征与预测字符之间的对齐。
- 在两个解码方向上同时进行端到端联合训练,以优化联合性能。
实验结果
研究问题
- RQ1是否可以使用单个共享解码器而非两个独立解码器,有效实现双向场景文本识别?
- RQ2通过方向嵌入实现的输入级别任务条件化,是否能使单个Transformer解码器在准确率和效率上超越双解码器架构?
- RQ3单解码器方法在曲线、旋转及透视畸变文本上的泛化能力如何?
- RQ4Transformer模型中的注意力头是否针对某一特定解码方向进行了专门化设计,还是在两种方向间学习到了共享表征?
- RQ5与基于RNN和双解码器Transformer基线模型相比,该模型在长序列识别任务上的表现如何?
主要发现
- Bi-STET在所有标准基准(包括IIIT-5K、ICDAR2013和CUTE80)上均优于或匹配最先进STR方法。
- 该模型以50%的训练迭代次数和显著更少的模型参数,实现了最先进性能,优于双解码器方法。
- Bi-STET对曲线和透视畸变文本表现出强鲁棒性,即使在强烈畸变下也能正确识别如'‘ballys’和‘chathamkent’等单词。
- 该模型在长序列(最长达17个字符)上保持高准确率,在超过11个字符的序列上优于先前的双解码器方法。
- 注意力头并未针对单一解码方向进行专门化;相反,它们在从左到右和从右到左解码中均被有效共享和利用。
- 该方法在具有挑战性的文本变体(包括旋转和倾斜文字)上泛化良好,无需显式校正模块。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。