[论文解读] A Binary Convolutional Encoder-decoder Network for Real-time Natural Scene Text Processing
该论文提出B-CEDNet,一种二值卷积编码器-解码器网络,通过在单次前向传播中联合检测和识别多个字符,实现了实时自然场景文本处理。通过在训练中施加二值约束,使权重和激活值均为二值,其在ICDAR-13上的像素级准确率达到91%,推理时间仅4.59 ms,模型大小为2.14 MB——比全精度版本快8倍、小96%。
In this paper, we develop a binary convolutional encoder-decoder network (B-CEDNet) for natural scene text processing (NSTP). It converts a text image to a class-distinguished salience map that reveals the categorical, spatial and morphological information of characters. The existing solutions are either memory consuming or run-time consuming that cannot be applied to real-time applications on resource-constrained devices such as advanced driver assistance systems. The developed network can process multiple regions containing characters by one-off forward operation, and is trained to have binary weights and binary feature maps, which lead to both remarkable inference run-time speedup and memory usage reduction. By training with over 200, 000 synthesis scene text images (size of $32 imes128$), it can achieve $90\%$ and $91\%$ pixel-wise accuracy on ICDAR-03 and ICDAR-13 datasets. It only consumes $4.59\ ms$ inference run-time realized on GPU with a small network size of 2.14 MB, which is up to $8 imes$ faster and $96\%$ smaller than it full-precision version.
研究动机与目标
- 解决资源受限设备上实时自然场景文本处理(NSTP)中缺乏内存高效且低延迟解决方案的问题。
- 克服现有词级和字符级识别方法中顺序字符检测的局限性以及高内存占用的问题。
- 通过显著性图学习空间、类别和形态信息,实现在一次前向传播中并行预测多个字符。
- 通过二值权重和激活约束,在不牺牲识别准确率的前提下实现高推理速度和低内存消耗。
提出的方法
- 设计一种二值编码器-解码器架构,并引入适配器模块,在处理前将输入图像转换为二值格式。
- 使用XNOR运算实现二值卷积层,以实现高效计算,替代标准卷积。
- 在每个编码器模块中应用批量归一化和最大池化,以稳定训练并下采样特征。
- 在解码器中使用转置卷积层,上采样并重建与输入图像尺寸匹配的高分辨率显著性图。
- 在每个模块后引入二值化层,强制激活值为二值,从而实现位级并行。
- 使用交叉熵损失函数进行网络训练,采用像素级类别监督,输出为27类(26个字母+背景)的概率分布。
实验结果
研究问题
- RQ1二值卷积编码器-解码器网络是否能在保持实时推理速度的同时,在自然场景文本处理中实现高准确率?
- RQ2使用二值权重和激活在不降低识别性能的前提下,是否能有效减少内存占用并加速推理?
- RQ3所提出的网络是否能在单次前向传播中同时检测和识别多个字符,优于顺序检测方法?
- RQ4当在合成数据上进行训练时,模型在光照和对比度变化等真实世界差异下的泛化能力如何?
- RQ5与标准卷积核相比,XNOR核优化对推理速度和内存消耗的影响如何?
主要发现
- B-CEDNet在ICDAR-03和ICDAR-13基准数据集上分别实现了90%和91%的像素级准确率,仅使用20万张合成训练图像。
- 在TITAN X GPU上,每张图像的推理时间仅为4.59 ms,比全精度版本快8倍。
- 由于采用二值权重和激活,内存使用量降低至2.14 MB,比全精度模型的66.12 MB减少了96%。
- XNOR核优化在计算最密集的模块(block-8)中实现了最高的加速比(17.7×),表明其在计算强度较高时具有良好的可扩展性。
- 显著性图在正常光照和对比度条件下表现出高置信度,但在光照不均或低对比度区域置信度较低,表明通过增强训练数据可进一步改进性能。
- 模型在标准条件下表现稳健,其准确率可通过扩展训练集以包含更具挑战性的现实场景进一步提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。