[论文解读] Abstractive Text Classification Using Sequence-to-convolution Neural Networks
本文提出序列到卷积神经网络(Seq2CNN),一种两阶段深度学习模型,首先利用基于注意力机制的RNN编码器-解码器模块对可变长度文本进行抽象摘要,然后通过卷积神经网络对摘要进行分类。关键贡献是一种新颖的训练方案——渐进权重转移(GWS),该方案稳定了端到端训练,并在AG新闻数据集上实现了90.36%的最先进准确率,优于标准TextCNN及未使用GWS的模型。
We propose a new deep neural network model and its training scheme for text classification. Our model Sequence-to-convolution Neural Networks(Seq2CNN) consists of two blocks: Sequential Block that summarizes input texts and Convolution Block that receives summary of input and classifies it to a label. Seq2CNN is trained end-to-end to classify various-length texts without preprocessing inputs into fixed length. We also present Gradual Weight Shift(GWS) method that stabilizes training. GWS is applied to our model's loss function. We compared our model with word-based TextCNN trained with different data preprocessing methods. We obtained significant improvement in classification accuracy over word-based TextCNN without any ensemble or data augmentation.
研究动机与目标
- 解决传统TextCNN因依赖序列长度参数而需固定输入长度的局限性。
- 实现在可变长度文本上无需预处理(如填充或裁剪)的端到端文本分类模型训练。
- 通过利用抽象摘要技术保留长序列或可变长度输入中的关键语义内容,提升分类性能。
- 通过一种新颖的训练方案,稳定具有双重目标(摘要生成与分类)的多任务模型训练。
- 证明通过RNN实现的抽象摘要可超越Extraction方法(如TextRank)在下游文本分类任务中的表现。
提出的方法
- 使用基于注意力机制的编码器-解码器RNN(序列模块)从输入文本生成抽象摘要,保留关键内容。
- 将生成的摘要输入基于TextCNN的分类头(卷积模块)以预测文本类别。
- 在两个模块之间共享非静态词嵌入层,以实现参数共享与联合优化。
- 实施一种名为渐进权重转移(GWS)的新训练策略,动态平衡摘要与分类目标之间的损失权重。
- 通过逐步降低摘要损失(序列损失)的权重并增加分类损失的权重来实现GWS。
- 使用基于词级别交叉熵的一般序列损失函数,比较预测与真实摘要标记之间的差异,未来可进一步采用代理损失进行优化。
实验结果
研究问题
- RQ1与固定序列模型相比,抽象摘要是否能提升可变长度输入的文本分类性能?
- RQ2在无需数据预处理的端到端训练下,结合摘要与分类的两阶段模型是否优于标准TextCNN?
- RQ3采用动态平衡损失函数的多任务训练方案是否能稳定训练并提升序列到序列分类模型的收敛性?
- RQ4与标准训练相比,所提出的渐进权重转移(GWS)方法在损失稳定性与最终分类准确率方面表现如何?
- RQ5当抽取式摘要方法(如TextRank)在短文本上失效时,该模型在短文本上的鲁棒性如何?
主要发现
- 在AG新闻数据集上,使用渐进权重转移(GWS)训练的Seq2CNN模型测试准确率达到90.36%,显著优于未使用GWS的相同模型(89.87%)和标准Vanilla CNN(89.67%)。
- 采用GWS的模型表现出稳定的训练损失曲线,总损失与序列损失均平稳收敛;而未使用GWS的模型在2000步后序列损失出现波动。
- Seq2CNN对短文本具有鲁棒性,即使在TextRank无法生成输出的极短输入下仍能成功生成摘要。
- 该模型在不使用集成方法或数据增强的情况下,优于基于词的TextCNN,表明抽象摘要与端到端训练的有效性。
- 抽象摘要模块能有效捕捉长序列与可变长度输入中的关键内容,使高性能分类无需输入长度预处理。
- 所提出的GWS训练方案具有通用性,可通过调整损失权重调度策略,应用于其他具有序列与分类目标的多任务模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。