Skip to main content
QUICK REVIEW

[论文解读] Pre-training is a Hot Topic: Contextualized Document Embeddings Improve Topic Coherence

Federico Bianchi, Silvia Terragni|arXiv (Cornell University)|Apr 8, 2020
Topic Modeling被引用 6
一句话总结

本文提出将预训练语言模型(特别是SBERT)生成的上下文化文档嵌入整合到神经主题模型中,具体通过将句子级上下文表示引入ProdLDA模型进行扩展。该方法在多个数据集上显著提升了主题一致性,表明潜在的上下文信息可超越传统词袋模型和现有神经主题模型,进一步提升主题质量。

ABSTRACT

Topic models extract groups of words from documents, whose interpretation as a topic hopefully allows for a better understanding of the data. However, the resulting word groups are often not coherent, making them harder to interpret. Recently, neural topic models have shown improvements in overall coherence. Concurrently, contextual embeddings have advanced the state of the art of neural models in general. In this paper, we combine contextualized representations with neural topic models. We find that our approach produces more meaningful and coherent topics than traditional bag-of-words topic models and recent neural models. Our results indicate that future improvements in language models will translate into better topic models.

研究动机与目标

  • 通过整合上下文化的词和句子表示,提升神经主题模型的主题一致性。
  • 解决词袋(BoW)表示的局限性,后者忽略了对主题一致性至关重要的句法和语义关系。
  • 探究像SBERT这样的预训练上下文嵌入是否能提升主题建模性能。
  • 证明语言建模的进展可通过提升上下文理解能力,直接惠及主题建模。
  • 提供一种简单、可扩展的框架,用于将上下文嵌入整合到现有神经主题模型中。

提出的方法

  • 通过用SBERT生成的上下文化文档嵌入替换原始的词袋输入,扩展ProdLDA神经主题模型。
  • 使用SBERT为整个文档生成句子嵌入,以捕捉语义和句法上下文。
  • 将SBERT嵌入与原始BoW表示拼接,作为神经主题模型的输入。
  • 使用黑箱变分推断训练模型,以优化对数似然的变分下界。
  • 通过一个大小等于词汇表的全连接层对SBERT嵌入进行投影,以匹配主题模型的输入维度。
  • 确保与任何基于自编码器的主题模型以及任何预训练的句子编码器兼容,使方法具备模块化和通用性。

实验结果

研究问题

  • RQ1与传统的词袋输入相比,上下文化文档嵌入是否能提升神经主题模型的主题一致性?
  • RQ2预训练上下文表示的整合如何影响主题的多样性与可解释性?
  • RQ3预训练句子编码器的选择(如RoBERTa与BERT)是否会影响主题一致性的表现?
  • RQ4语言模型性能的提升在多大程度上能转化为更好的主题建模结果?
  • RQ5尽管SBERT等模型存在输入长度限制,长文档是否仍能通过上下文嵌入有效表示?

主要发现

  • 所提出的CombinedTM模型在所有数据集上均显著优于传统BoW基线模型和近期神经主题模型(如MetaLDA),t检验结果p < 0.05。
  • 在20Newsgroups数据集上,模型的加权平均一致性得分为0.12,仅在最佳情况下略低于MetaLDA的0.13,但在其他数据集上表现出一致的改进。
  • 在Wiki20K数据集上,模型在100个主题下的得分达到0.18,显著优于MetaLDA的0.13(p < 0.05)。
  • 使用基于RoBERTa的SBERT(stsb-roberta-large)获得的一致性优于基于BERT的SBERT(bert-base-nli-mean),表明上下文编码器的质量具有重要影响。
  • 该模型在显著提升主题一致性的同时,保持了具有竞争力的主题多样性,表明主题质量得到了全面而平衡的提升。
  • 结果表明,未来预训练语言模型的进展将通过更优的上下文表征学习,直接惠及主题建模。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。