Skip to main content
QUICK REVIEW

[论文解读] Semi-supervised Clustering for Short Text via Deep Representation Learning

Zhiguo Wang, Haitao Mi|arXiv (Cornell University)|Feb 22, 2016
Topic Modeling参考文献 18被引用 11
一句话总结

本文提出了一种用于短文本的半监督聚类框架,通过少量标注数据联合优化深度神经网络表征学习与k-means聚类。通过将标注数据整合到统一目标函数中,并在聚类分配、质心更新与神经网络优化之间交替进行,该方法在四个短文本数据集上显著优于无监督和有监督基线方法,其中半监督CNN变体达到了最先进性能。

ABSTRACT

In this work, we propose a semi-supervised method for short text clustering, where we represent texts as distributed vectors with neural networks, and use a small amount of labeled data to specify our intention for clustering. We design a novel objective to combine the representation learning process and the k-means clustering process together, and optimize the objective with both labeled data and unlabeled data iteratively until convergence through three steps: (1) assign each short text to its nearest centroid based on its representation from the current neural networks; (2) re-estimate the cluster centroids based on cluster assignments from step (1); (3) update neural networks according to the objective by keeping centroids and cluster assignments fixed. Experimental results on four datasets show that our method works significantly better than several other text clustering methods.

研究动机与目标

  • 解决无监督方法在短文本聚类中面临的词汇稀疏性与意图不明确问题。
  • 将有限的标注数据整合到聚类过程中,根据用户定义的意图引导聚类形成。
  • 将深度表征学习与聚类统一为单一端到端优化框架。
  • 通过联合学习过程利用标注数据与未标注数据,提升短文本聚类质量。
  • 证明深度神经网络(CNN/LSTM)在半监督短文本聚类中优于传统向量表示方法(如TF-IDF、词袋模型)。

提出的方法

  • 使用预训练嵌入将每个短文本表示为密集词向量序列。
  • 采用两种深度神经网络架构——CNN与LSTM——从词向量序列中学习固定大小的文本表征。
  • 定义一个联合目标函数,将k-means聚类损失与标注数据的惩罚项结合,以指导表征学习。
  • 通过三步迭代优化目标函数:(1) 基于当前神经网络表征将文本分配到最近的质心;(2) 根据分配结果重新估计聚类质心;(3) 在保持质心与分配结果固定的情况下更新神经网络参数。
  • 利用标注数据约束聚类目标,确保学习到的表征与用户指定的聚类意图对齐。
  • 在交替优化循环中端到端训练模型,使用标注数据与未标注数据,直至收敛。

实验结果

研究问题

  • RQ1联合优化深度表征学习与聚类是否能超越传统无监督方法,提升短文本聚类性能?
  • RQ2将少量标注数据整合到聚类目标中,对引导短文本聚类形成的效果如何?
  • RQ3在半监督短文本聚类中,使用深度神经网络(CNN/LSTM)作为文本编码器是否优于传统向量表示方法(如TF-IDF、词袋模型)?
  • RQ4与基线聚类系统相比,所提出方法在提升聚类边界清晰度与分离度方面达到何种程度?
  • RQ5与现有将表征学习与聚类分离的半监督聚类方法相比,所提出的框架是否更具有效性?

主要发现

  • 所提出的使用CNN表征的半监督聚类方法(semi-cnn)在所有四个评估数据集中均取得了最佳性能。
  • 该方法显著优于无监督基线方法,如基于词袋模型与TF-IDF表征的k-means。
  • 使用深度学习表征(CNN/LSTM)的半监督方法超越了基于度量学习的有监督方法,表明非线性表征学习具有优势。
  • 可视化结果表明,与无监督或纯表征方法相比,所提出方法使聚类边界更加清晰。
  • 迭代优化过程实现收敛,并生成了更一致且与意图对齐的聚类,尤其在利用标注数据引导聚类目标时表现更优。
  • 该方法在多种短文本数据集上表现出鲁棒性,包括问答类与产品评论数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。