[论文解读] Building Efficient CNN Architecture for Offline Handwritten Chinese Character Recognition
该论文提出了一种高效的CNN架构,用于离线手写中文字符识别,采用全局加权平均池化(Global Weighted Average Pooling)减少全连接层参数量,并采用带有中间层输出的级联模型以加速推理。该方法在仅3.3MB存储空间和6.9ms平均推理时间(CPU上)下实现了97.1%的准确率,优于以往工作在效率与准确率方面的表现。
Deep convolutional networks based methods have brought great breakthrough in images classification, which provides an end-to-end solution for handwritten Chinese character recognition(HCCR) problem through learning discriminative features automatically. Nevertheless, state-of-the-art CNNs appear to incur huge computation cost, and require the storage of a large number of parameters especially in fully connected layers, which is difficult to deploy such networks into alternative hardware device with the limit of computation amount. To solve the storage problem, we propose a novel technique called Global Weighted Arverage Pooling for reducing the parameters in fully connected layer without loss in accuracy. Besides, we implement a cascaded model in single CNN by adding mid output layer to complete recognition as early as possible, which reduces average inference time significantly. Experiments were performed on the ICDAR-2013 offline HCCR dataset, and it is found that the proposed approach only needs 6.9ms for classfying a chracter image on average, and achieves the state-of-the-art accuracy of 97.1% while requiring only 3.3MB for storage.
研究动机与目标
- 解决当前最先进的CNN在离线手写中文字符识别(HCCR)中计算与存储成本过高的问题。
- 在不损失准确率的前提下,减少全连接层的参数数量。
- 通过中间层输出层实现早期分类,从而加速推理过程。
- 通过模型压缩与量化,实现资源受限硬件上的部署。
提出的方法
- 采用SqueezeNet中的Fire模块构建紧凑的CNN架构,实现低FLOPs与低参数量。
- 提出全局加权平均池化(GWAP)以替代标准全连接层,减少参数量同时保持准确率。
- 设计级联CNN结构,增加中间层输出分支,对大量输入实现早期分类,降低平均推理时间。
- 采用两阶段训练策略:先训练基础网络与最终分类器,再单独微调中间层输出分支以提升性能。
- 对卷积层应用8位定点量化,对全连接层应用4位量化,进一步压缩模型大小,且准确率损失可忽略不计。
- 采用类别概率阈值(如0.98)在置信度高时触发早期推理,提升平均推理速度。
实验结果
研究问题
- RQ1全局加权平均池化是否能有效减少全连接层参数量,同时在HCCR中保持高识别准确率?
- RQ2在单一CNN架构中引入中间层输出分支,是否能显著降低平均推理时间而不损害最终准确率?
- RQ3基于置信度阈值的级联推理与早期停止策略,对整体速度与准确率权衡有何影响?
- RQ4模型量化在HCCR中能将存储需求降低到何种程度,同时保持最小的准确率损失?
- RQ5紧凑高效的CNN架构是否能在ICDAR-2013 HCCR基准上实现最先进性能?
主要发现
- 所提出的级联模型在ICDAR-2013数据集上实现了97.14%的最先进识别准确率,优于以往方法。
- 平均推理时间降低至每张字符图像6.93ms,相比基线模型提升25%,主要得益于约76%的输入在中间层即被提前分类。
- 全连接层经4位量化后,模型仅需3.3MB存储空间,显著低于以往工作,内存占用大幅减少。
- HCCR-WAP变体在仅增加0.03MB参数量的前提下实现96.91%准确率,证明GWAP在参数压缩方面的有效性。
- 中间层与最终分类器分开训练的策略,最终准确率达到96.91%,优于多任务训练的96.31%,验证了训练策略的合理性。
- 最终模型计算量仅为94MFLOPs,使其在基于CPU的设备上具有极高的部署效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。