Skip to main content
QUICK REVIEW

[论文解读] Supporting Clustering with Contrastive Learning

Dejiao Zhang, Nan Feng|arXiv (Cornell University)|Mar 24, 2021
Domain Adaptation and Few-Shot Learning参考文献 50被引用 8
一句话总结

本文提出了一种支持聚类的对比学习(SCCL)方法,这是一种新颖的端到端框架,通过联合优化实例级对比学习与聚类目标,以提升无监督短文本聚类性能。通过利用对比学习增强类间分离性,同时利用聚类增强类内紧凑性,SCCL在基准数据集上实现了最先进性能,准确率提升3%-11%,标准化互信息(NMI)提升4%-15%。

ABSTRACT

Unsupervised clustering aims at discovering the semantic categories of data according to some distance measured in the representation space. However, different categories often overlap with each other in the representation space at the beginning of the learning process, which poses a significant challenge for distance-based clustering in achieving good separation between different categories. To this end, we propose Supporting Clustering with Contrastive Learning (SCCL) -- a novel framework to leverage contrastive learning to promote better separation. We assess the performance of SCCL on short text clustering and show that SCCL significantly advances the state-of-the-art results on most benchmark datasets with 3%-11% improvement on Accuracy and 4%-15% improvement on Normalized Mutual Information. Furthermore, our quantitative analysis demonstrates the effectiveness of SCCL in leveraging the strengths of both bottom-up instance discrimination and top-down clustering to achieve better intra-cluster and inter-cluster distances when evaluated with the ground truth cluster labels.

研究动机与目标

  • 为解决表示空间中语义类别重叠的问题,该问题阻碍了高维数据中的基于距离的聚类。
  • 提升无监督短文本聚类性能,尤其针对噪声、稀疏性和监督信息有限的挑战。
  • 将自底向上的实例级对比学习与自顶向下的聚类损失相结合,以增强类内紧凑性与类间分离性。
  • 探究在自然语言处理中有效的文本数据增强策略,以支持对比学习,考虑到文本的离散性与语义敏感性。
  • 开发一种更简单的端到端框架,避免以往深度聚类方法中常见的多阶段训练流程。

提出的方法

  • SCCL联合优化原始文本实例的聚类损失与增强数据对的实例级对比损失。
  • 该框架采用数据增强技术,如WordNet同义词替换、基于BERT/RoBERTa的上下文词替换,以及基于回译的释义生成,以生成正样本对。
  • 对比学习促使同一文本的不同增强视图的表示相互靠近,同时将不同文本的表示相互推开。
  • 聚类损失促使嵌入空间中同一语义类别内的样本形成更密集的聚类。
  • 模型采用双头架构进行端到端训练,同一主干网络处理原始输入与增强输入。
  • 该方法评估了多种增强策略组合的效果,发现其在极短文本上可能因语义漂移而降低性能。

实验结果

研究问题

  • RQ1实例级对比学习是否能通过增强表示空间中的类间分离性,有效提升聚类性能?
  • RQ2将自底向上的对比学习与自顶向下的聚类损失相结合,如何影响类内紧凑性与类间分离性?
  • RQ3在自然语言处理领域,哪些文本增强策略能生成最有效的正样本对用于对比学习?
  • RQ4组合多种增强策略是否能提升性能,还是可能因语义漂移而带来风险,尤其是在短文本聚类中?
  • RQ5与多阶段方法相比,SCCL能否通过更简单的端到端训练范式实现最先进性能?

主要发现

  • SCCL在八个基准短文本聚类数据集上达到最先进性能,准确率提升3%-11%,标准化互信息(NMI)提升4%-15%。
  • 上下文增强器(利用BERT/RoBERTa进行词替换)优于WordNet与基于回译的增强器,因其生成的扰动更具语义信息。
  • 增强策略的组合在较长文本(如GoogleNews-TS)上提升性能,但在较短文本(如StackOverflow)上反而损害性能,因语义漂移更显著。
  • t-SNE可视化显示,与基线模型相比,SCCL显著减少了类间重叠,并提升了聚类纯度。
  • 消融实验表明,对比损失与聚类损失协同作用,显著改善了类内与类间距离。
  • 该框架具有通用性与高效性,适用于多种文本聚类任务,且具备向其他模态扩展的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。