[论文解读] Large Language Models Offer an Alternative to the Traditional Approach of Topic Modelling
这篇论文评估大语言模型(LLMs)是否能够直接从语料库中提取和总结主题,并将 GPT-3.5 和 LLaMA-2-7B 与 LDA 和 BERTopic 进行比较,结合提示工程、种子词和摘要以生成可供人类解释的主题与评估指标。
Topic modelling, as a well-established unsupervised technique, has found extensive use in automatically detecting significant topics within a corpus of documents. However, classic topic modelling approaches (e.g., LDA) have certain drawbacks, such as the lack of semantic understanding and the presence of overlapping topics. In this work, we investigate the untapped potential of large language models (LLMs) as an alternative for uncovering the underlying topics within extensive text corpora. To this end, we introduce a framework that prompts LLMs to generate topics from a given set of documents and establish evaluation protocols to assess the clustering efficacy of LLMs. Our findings indicate that LLMs with appropriate prompts can stand out as a viable alternative, capable of generating relevant topic titles and adhering to human guidelines to refine and merge topics. Through in-depth experiments and evaluation, we summarise the advantages and constraints of employing LLMs in topic extraction.
研究动机与目标
- 推动将LLMs作为开放领域和领域特定语料的可插即用替代传统主题建模的方法。
- 研究提示技巧,包括约束和种子,以引导LLMs朝向细粒度、可人类解释的主题。
- 制定评估协议以评估主题质量、颗粒度以及与人类期望的一致性。
- 展示一个关于疫苗犹豫的时间序列分析的案例研究,以展示动态主题提取与摘要的能力。
- 在数据集上比较LLM驱动的主题提取与传统方法(LDA、BERTopic)。
提出的方法
- 使用 GPT-3.5 和 LLaMA-2-7B 作为基础 LLM,从文档集提取主题。
- 使用系统和用户消息进行提示,以生成主题列表,探索开箱、约束和手动后处理。
- 引入种子主题以引导粒度并减少主题重叠。
- 应用摘要步骤将主题合并并提炼为最终的 Top-N 列表及解释。
- 提出评估指标包括主题距离(Jaccard)和语义粒度(BERT 余弦相似度)以及对种子主题的召回/精度。
- 提供一个关于COVID-19 疫苗犹豫的 Twitter 数据时间分析的案例研究,以说明随时间的动态。

实验结果
研究问题
- RQ1LLMs 是否能够直接从原始文本中在不经过经典主题建模预处理的情况下生成有意义、可人类解释的主题?
- RQ2提示策略(基础提示、种子、摘要)如何影响开放领域和领域特定语料的主题质量与粒度?
- RQ3哪些评估指标最能捕捉到 LLM 生成主题的质量、独特性与粒度?
- RQ4LLMs 能否在动态语料(如时间性 Twitter 数据)中适应演变中的主题,而无需重新运行传统模型?
主要发现
- 在适当的提示和约束引导下,LLMs 可以生成可解释且符合人类期望的主题。
- 种子主题在各数据集和各 LLM 中持续提高主题提取的质量和粒度。
- 最终的 Top-N 摘要步骤产生一组紧凑、具代表性的主题,覆盖大多数原始类别并提供解释。
- 评估指标显示最终主题列表在很大程度上彼此独立(重叠较低),且随着 Top-N 集合增大,语义粒度提升。
- 在时间性疫苗犹豫案例研究中,LLMs 展现出随时间提取演变主题并给出描述性分析的能力(如通过 GPT-4 描述)。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。