Skip to main content
QUICK REVIEW

[论文解读] Light-Weighted CNN for Text Classification

Ritu Yadav|arXiv (Cornell University)|Apr 16, 2020
Handwritten Text Recognition Techniques参考文献 23被引用 5
一句话总结

本文提出一种轻量级CNN架构用于文本分类,采用深度可分离卷积和空洞卷积,将可训练参数数量大幅减少约300,000个,同时提升准确率并使训练时间最多缩短四倍。该方法在损失值更低、收敛速度更快方面表现优异,尤其在使用双优化器调度(Adam转为带动量的SGD)时效果显著,使其在资源受限的业务文档分类场景中具有高度实用性。

ABSTRACT

For management, documents are categorized into a specific category, and to do these, most of the organizations use manual labor. In today's automation era, manual efforts on such a task are not justified, and to avoid this, we have so many software out there in the market. However, efficiency and minimal resource consumption is the focal point which is also creating a competition. The categorization of such documents into specified classes by machine provides excellent help. One of categorization technique is text classification using a Convolutional neural network(TextCNN). TextCNN uses multiple sizes of filters, as in the case of the inception layer introduced in Googlenet. The network provides good accuracy but causes high memory consumption due to a large number of trainable parameters. As a solution to this problem, we introduced a whole new architecture based on separable convolution. The idea of separable convolution already exists in the field of image classification but not yet introduces to text classification tasks. With the help of this architecture, we can achieve a drastic reduction in trainable parameters.

研究动机与目标

  • 解决标准TextCNN因可训练参数数量庞大而导致的高内存消耗问题。
  • 探索并适配图像分类中的深度学习技术——特别是可分离卷积与空洞卷积——用于文本分类任务。
  • 在不牺牲分类准确率的前提下,减少模型大小与训练时间。
  • 通过自适应学习率与双优化器调度(Adam转为带动量的SGD)优化超参数与训练动态。
  • 在真实业务文档数据集(Tobacco-3482)上评估所提架构,以验证其在实际部署中的可行性。

提出的方法

  • 将TextCNN中的标准卷积滤波器替换为深度可分离卷积,通过解耦空间操作与通道操作,显著降低参数数量。
  • 应用空洞卷积以在不增加参数量的情况下扩大感受野,同时保持上下文建模能力。
  • 采用双优化器策略:初始阶段使用Adam实现快速收敛,随后切换至带动量的SGD进行微调,提升稳定性和性能。
  • 通过大量实验优化超参数,包括学习率衰减、L2正则化、批量大小以及Leaky ReLU的α值。
  • 引入批量归一化以加速训练过程并提升泛化能力。
  • 在完整数据集(Tobacco-3482)与小型数据集(Tobacco small-3482)上评估模型,以检验其可扩展性与过拟合情况。

实验结果

研究问题

  • RQ1深度可分离卷积是否能在不降低性能的前提下,有效减少文本分类模型中的可训练参数数量?
  • RQ2在参数更少的情况下,空洞卷积与标准滤波器相比,在捕捉文本中的长距离依赖关系方面表现如何?
  • RQ3与单优化器训练相比,采用双优化器策略(先Adam后带动量的SGD)是否能提升收敛速度与最终准确率?
  • RQ4通过超参数调优与网络架构修改,能在多大程度上缩短训练时间,同时保持或提升模型准确率?
  • RQ5所提出的轻量级架构是否能在真实业务文档分类基准上实现具有竞争力的性能表现?

主要发现

  • 所提出的轻量级CNN相较于基础TextCNN,将可训练参数数量减少了约300,000个,在完整数据集上达到16,496,856个参数。
  • 在Tobacco-3482数据集上,该模型实现了43.5%的准确率,损失值为1.90,显著低于基础模型的3.21,尽管准确率略低于优化版本。
  • 在完整数据集上,采用双优化器策略后,训练时间缩短至约26分钟(相比约2小时),实现四倍加速。
  • 在小型Tobacco small-3482数据集上,双优化器策略使训练时间缩短至仅2分钟,而基础模型需9分钟。
  • 可分离卷积、空洞卷积与双优化器调度的结合,显著提升了收敛速度与训练稳定性,完整数据集上的损失值降低超过30%。
  • 该模型在压缩与性能之间实现了良好平衡,在小型数据集上保持83%的高准确率,同时大幅降低内存消耗与训练时长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。