Skip to main content
QUICK REVIEW

[论文解读] Topic Modeling with Contextualized Word Representation Clusters

Laure Thompson, David Mimno|arXiv (Cornell University)|Oct 23, 2020
Topic Modeling参考文献 45被引用 13
一句话总结

本文提出一种简单方法,通过聚类 BERT 和 GPT-2 等模型的标记级上下文嵌入,从上下文嵌入中提取主题模型。结果表明,这些聚类生成的主题模型在质量上可与或优于 LDA,能够捕捉多义性,并支持无需额外计算的可解释、基于文档的主题分析。

ABSTRACT

Clustering token-level contextualized word representations produces output that shares many similarities with topic models for English text collections. Unlike clusterings of vocabulary-level word embeddings, the resulting models more naturally capture polysemy and can be used as a way of organizing documents. We evaluate token clusterings trained from several different output layers of popular contextualized language models. We find that BERT and GPT-2 produce high quality clusterings, but RoBERTa does not. These cluster models are simple, reliable, and can perform as well as, if not better than, LDA topic models, maintaining high topic quality even when the number of topics is large relative to the size of the local collection.

研究动机与目标

  • 探索是否可以通过对上下文嵌入的标记级聚类,生成与传统 LDA 相当的主题模型。
  • 评估不同上下文语言模型——BERT、GPT-2 和 RoBERTa——在生成有意义主题聚类方面的表现。
  • 证明此类聚类与文档上下文相关联,并支持实际的语料分析任务,如主题追踪和方面检测。
  • 表明该方法无需额外训练或复杂建模,使已使用 BERT 类模型的研究人员可轻松应用。
  • 识别 RoBERTa 尽管架构与 BERT 相似,但其输出存在局限,暗示其表征学习存在更深层次的差异。

提出的方法

  • 对 BERT、GPT-2 和 RoBERTa 最后一层提取的标记级上下文嵌入应用 k-means 聚类。
  • 将所得聚类分配结果作为主题标签,其中每个聚类代表一个独立的语义主题或主题。
  • 通过可解释性、多义性捕捉能力以及下游分析任务(如随时间或文档类别变化的主题普遍性)来评估主题质量。
  • 通过在预定义文档分区(如产品类别、年份)内统计每个聚类的标记分配数量,进行事后分析,以估算主题的显著性。
  • 使用基于熵的度量方法识别与任何单一类别关联性不强的主题,表明其为细微或主观性主题。
  • 通过在英文文本语料上使用定性和定量指标,将基于聚类的主题模型与标准 LDA 进行性能比较。

实验结果

研究问题

  • RQ1对上下文嵌入的标记级聚类能否生成在功能和定性上与 LDA 相当的主题模型?
  • RQ2不同上下文语言模型——BERT、GPT-2 和 RoBERTa——在生成可解释且语义一致的主题聚类方面表现如何?
  • RQ3此类聚类在多大程度上能捕捉多义性和上下文变化,例如 'land' 作为动词或名词的多种含义?
  • RQ4所生成的主题模型能否有效用于实际语料分析任务,如随时间追踪主题趋势或在产品评论中识别方面?
  • RQ5为何 RoBERTa 尽管架构与 BERT 相似,且预训练目标相同,却产生质量更低的聚类?

主要发现

  • BERT 和 GPT-2 生成了高质量的主题聚类,能够捕捉多义性及句法变化,例如 'land' 作为动词或名词的不同含义。
  • 尽管 RoBERTa 与 BERT 架构相似,但其生成的聚类质量显著更低,常导致极小、特定或难以解释的主题。
  • 即使在主题数量较多(如 K=500)的情况下,基于聚类的主题模型仍保持高质量,其可解释性和连贯性优于或至少不逊于 LDA。
  • 对上下文嵌入的标记级聚类支持实用的分析任务,如在不同产品类别中估计主题普遍性,以及在多年时间序列中追踪主题变化。
  • 在各类别间熵较低的主题——如 'overkill'、'possibilities' 和 'time periods'——代表细微、主观或语篇层面的主题,标准停用词过滤无法捕捉此类主题。
  • 该方法无需额外训练或复杂推理;它利用现有的 BERT 类工作流,使研究人员可轻松将其作为 LDA 的即插即用替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。