Skip to main content
QUICK REVIEW

[论文解读] Variational Autoencoders for Semi-supervised Text Classification

Weidi Xu, Haoze Sun|arXiv (Cornell University)|Mar 8, 2016
Text and Document Classification Technologies被引用 6
一句话总结

本文提出半监督序列变分自编码器(SSVAE),通过在每个时间步将类别标签作为条件输入解码器LSTM,从而有效利用未标注数据提升文本分类性能。该方法结合条件LSTM与基于采样的优化策略,在IMDB和AG's News数据集上实现了最先进(SOTA)的性能表现,同时降低了方差与计算成本。

ABSTRACT

Although semi-supervised variational autoencoder (SemiVAE) works in image classification task, it fails in text classification task if using vanilla LSTM as its decoder. From a perspective of reinforcement learning, it is verified that the decoder's capability to distinguish between different categorical labels is essential. Therefore, Semi-supervised Sequential Variational Autoencoder (SSVAE) is proposed, which increases the capability by feeding label into its decoder RNN at each time-step. Two specific decoder structures are investigated and both of them are verified to be effective. Besides, in order to reduce the computational complexity in training, a novel optimization method is proposed, which estimates the gradient of the unlabeled objective function by sampling, along with two variance reduction techniques. Experimental results on Large Movie Review Dataset (IMDB) and AG's News corpus show that the proposed approach significantly improves the classification accuracy compared with pure-supervised classifiers, and achieves competitive performance against previous advanced methods. State-of-the-art results can be obtained by integrating other pretraining-based methods.

研究动机与目标

  • 解决在使用标准LSTM作为解码器时,原始半监督变分自编码器(SemiVAE)在文本分类任务中失效的问题。
  • 通过在每个解码步骤中引入标签信息,提升解码器对正确与错误标签的区分能力。
  • 通过提出一种基于采样的梯度估计方法,降低未标注目标函数的训练复杂度。
  • 通过借鉴强化学习中的基线方法,实现方差减少,从而稳定训练过程。
  • 证明所提出的模型在基准文本分类数据集上具备竞争力与最先进性能。

提出的方法

  • 引入一种条件LSTM解码器,使其在每个时间步接收类别标签,增强对标签的判别能力。
  • 提出两种特定的条件LSTM结构——CLSTM-I与CLSTM-II,分别将标签信息整合到细胞状态与输入门中。
  • 设计一种基于采样的优化方法,用于估计未标注目标函数的梯度,从而降低计算成本。
  • 应用两种基于强化学习基线方法的方差减少技术,以稳定训练过程。
  • 采用变分自编码器框架与Seq2Seq结构,结合序列分类器,其中潜在变量在重构与分类任务间共享。
  • 使用重参数化技巧,使反向传播能够通过随机潜在变量,实现端到端训练。

实验结果

研究问题

  • RQ1为何在使用标准LSTM作为解码器时,原始SemiVAE在文本分类任务中会失效?
  • RQ2在半监督设置下,如何增强解码器对不同标签的区分能力?
  • RQ3基于采样的优化方法是否能在不损失准确率的前提下降低半监督文本分类的训练复杂度?
  • RQ4在每个解码步骤中引入标签信息是否能提升真实世界文本数据集上的分类性能?
  • RQ5当结合预训练技术时,所提出的方法是否能实现最先进性能?

主要发现

  • 所提出的SSVAE模型在仅使用2.5K标注样本的IMDB数据集上,实现了10.3%的分类错误率,比监督LSTM模型高出7.7个百分点。
  • CLSTM-I与CLSTM-II两种结构均显著优于原始LSTM解码器,在IMDB与AG's News数据集上均取得优异结果。
  • 当结合基于预训练的方法时,该模型在IMDB数据集上实现了最先进性能。
  • KL散度分析显示,约10个潜在单元(共50个)保持非零值,表明潜在空间中实现了有效的信息编码。
  • t-SNE可视化结果表明,具有相似句法与词汇结构的句子在潜在空间中聚集在一起,证明了语义信息与标签信息的有效解耦。
  • 从相同潜在编码但不同标签生成的句子展现出一致的句法结构,但情感倾向相反,表明模型已学会根据标签条件生成内容。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。