Skip to main content
QUICK REVIEW

[论文解读] Do Convolutional Networks need to be Deep for Text Classification ?

Hoa T. Le, Christophe Cerisara|arXiv (Cornell University)|Jul 13, 2017
Topic Modeling参考文献 31被引用 70
一句话总结

论文比较浅层和深层CNN在文本分类中的表现,使用字符和词输入,发现浅层词级CNN通常优于深层字符模型,甚至在若干数据集接近或超过最先进方法,并且对文本进行了DenseNet改编。

ABSTRACT

We study in this work the importance of depth in convolutional models for text classification, either when character or word inputs are considered. We show on 5 standard text classification and sentiment analysis tasks that deep models indeed give better performances than shallow networks when the text input is represented as a sequence of characters. However, a simple shallow-and-wide network outperforms deep models such as DenseNet with word inputs. Our shallow word model further establishes new state-of-the-art performances on two datasets: Yelp Binary (95.9\%) and Yelp Full (64.9\%).

研究动机与目标

  • 评估网络深度对基于字符和词输入的文本分类性能的影响。
  • 在文本任务中将浅-宽 CNN 与深 CNN 和 DenseNet 风格架构进行比较。
  • 识别哪种输入粒度(字符 vs 词)在 CNN 的深度增加下受益最大。
  • 在选定数据集上使用词级浅模型展示最先进的结果。

提出的方法

  • 实现一个基于 Kim (2014) 的浅-宽 CNN,具有多种卷积核尺寸和全局最大池化。
  • 将 DenseNet 架构改造成文本的词级,并与字符级变体进行比较。
  • 在五个数据集上训练模型,使用 Adam 优化,标准化超参数;报告准确率。
  • 使用嵌入表征:词输入使用预训练的 word2vec,字符输入使用One-hot 编码。
  • 与广泛的基线和先前的最先进方法进行对比。

实验结果

研究问题

  • RQ1深度是否对字符级文本分类模型提供显著优势?
  • RQ2深度是否有利于词级文本分类,还是浅词级模型也能达到或超越最先进结果?
  • RQ3在标准文本分类数据集上,当深度变化时,字符级和词级输入的比较如何?
  • RQ4DenseNet 风格的文本模型是否能在任一输入层面提升性能?

主要发现

  • 深度的字符级模型相较于浅层模型在某些数据集上有一定提升,但并非对所有数据集都优于浅层模型。
  • 浅-宽的词级 CNN 在词级上表现出色,常常达到甚至超越深层模型。
  • 词级浅模型在 Yelp Binary (95.9%) 和 Yelp Full (64.9%) 上达到了最先进水平。
  • DenseNet 风格的词级变体可以接近但未始终超越浅层词级 CNN。
  • 总体而言,深模型并不在文本分类上普遍优于浅层模型;深度收益取决于数据集和输入。
  • 字符级深度的改进比词级深度的改进更明显,但词级浅模型仍然非常有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。