Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Document Clustering Based on BERT with Data Augment

Haoxiang Shi, Cen Wang|arXiv (Cornell University)|Nov 17, 2020
Text and Document Classification Technologies参考文献 30被引用 6
一句话总结

本文提出了一种基于 BERT 的自监督对比学习(SCL)与少样本对比学习(FCL)框架,结合无监督数据增强(UDA)用于文本聚类。通过利用回译和随机掩码生成正样本对,SCL 在短文本与长文本聚类基准上均取得了最先进性能;而结合 UDA 的 FCL 在短文本上尤其接近监督学习性能。

ABSTRACT

Contrastive learning is a promising approach to unsupervised learning, as it inherits the advantages of well-studied deep models without a dedicated and complex model design. In this paper, based on bidirectional encoder representations from transformers, we propose self-supervised contrastive learning (SCL) as well as few-shot contrastive learning (FCL) with unsupervised data augmentation (UDA) for text clustering. SCL outperforms state-of-the-art unsupervised clustering approaches for short texts and those for long texts in terms of several clustering evaluation measures. FCL achieves performance close to supervised learning, and FCL with UDA further improves the performance for short texts.

研究动机与目标

  • 为解决复杂生成式无监督聚类模型的局限性,提出一种判别式对比学习方法。
  • 在不依赖标注数据的前提下,提升短文本与长文本的聚类性能。
  • 探索无监督数据增强(UDA)在提升文本聚类对比学习性能方面的有效性。
  • 通过仅使用少量标注样本的少样本对比学习(FCL),实现接近监督学习的性能。
  • 开发一种可扩展的端到端框架,利用 BERT 表示与对比损失提升聚类效果。

提出的方法

  • 使用 BERT 将文本输入编码为稠密的潜在表示以用于聚类。
  • 应用多语言回译(BT)与随机掩码(RM)生成自监督对比学习(SCL)的正样本对。
  • 采用少量标注样本的少样本对比学习(FCL),其中正样本对来自同一类别。
  • 基于表示之间的余弦相似度设计对比损失函数,并引入温度参数以控制类内紧凑性与类间分离度。
  • 整合无监督数据增强(UDA)以进一步提升性能,尤其在短文本上表现更优。
  • 在微调后,对最终的 BERT 编码表示应用标准聚类算法进行聚类。

实验结果

研究问题

  • RQ1基于 BERT 的自监督对比学习是否能在短文本与长文本数据集上超越现有无监督聚类方法?
  • RQ2少样本对比学习(FCL)在多大程度上可实现接近监督学习的聚类性能?
  • RQ3无监督数据增强(UDA)在提升 FCL 性能方面,尤其在短文本上的作用如何?
  • RQ4不同数据增强策略——回译与随机掩码——在对比学习中生成正样本方面的影响如何?
  • RQ5与传统自编码器或生成模型相比,基于 BERT 表示的对比学习在聚类有效性方面表现如何?

主要发现

  • SCL 在多个评估指标(包括 NMI、AMI、ARI 和 BCubed F1)下,于短文本与长文本数据集上均达到最先进聚类准确率。
  • FCL 性能非常接近监督学习,证明了少样本监督在对比学习中的有效性。
  • 结合无监督数据增强(UDA)的 FCL 进一步提升了短文本的聚类性能,表明数据增强可增强低资源场景下的泛化能力。
  • 采用回译与随机掩码作为数据增强技术,能有效生成有意义的正样本,提升对比学习的稳定性和性能。
  • 引入温度缩放的对比损失能有效平衡类内紧凑性与类间分离度,从而提升聚类质量。
  • 所提方法在所有评估基准数据集上均优于强基线模型,如 SIF + Autoencoder、G-BAT 与 SS-SB-MT。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。