[论文解读] Experiments on Generalizability of BERTopic on Multi-Domain Short Text
本文评估了 BERTopic 在大学课程评价等多领域短文本上的表现,发现其在主题连贯性和多样性方面优于 LDA。然而,BERTopic 的默认 HDBSCAN 聚类会将 74% 的文档视为异常值,因此作者提出用 k-Means 替代 HDBSCAN,以保留所有文档,同时保持强劲的性能和对短文本的鲁棒性。
Topic modeling is widely used for analytically evaluating large collections of textual data. One of the most popular topic techniques is Latent Dirichlet Allocation (LDA), which is flexible and adaptive, but not optimal for e.g. short texts from various domains. We explore how the state-of-the-art BERTopic algorithm performs on short multi-domain text and find that it generalizes better than LDA in terms of topic coherence and diversity. We further analyze the performance of the HDBSCAN clustering algorithm utilized by BERTopic and find that it classifies a majority of the documents as outliers. This crucial, yet overseen problem excludes too many documents from further analysis. When we replace HDBSCAN with k-Means, we achieve similar performance, but without outliers.
研究动机与目标
- 评估 BERTopic 在包括多个院系的大学课程评价在内的多样化短文本领域中的泛化能力。
- 在短文本、多领域文本上,比较 BERTopic 与基线 LDA 模型在主题连贯性和多样性方面的表现。
- 研究 HDBSCAN 异常值检测对实际应用中模型实用性的负面影响,特别是在必须分析所有文档的场景中。
- 提出并评估 k-Means 作为 BERTopic 中 HDBSCAN 的替代方案,以消除异常值剔除,同时保持性能。
提出的方法
- 本研究在来自五个大学院系的 62,522 条学生反馈短文本语料上,应用 BERTopic(使用 HDBSCAN 聚类),并与 LDA 及 BERTopic(使用 k-Means 聚类)进行比较。
- 主题连贯性通过归一化点互信息(NPMI)进行度量,主题多样性则计算为所有主题中顶部 n 个词的唯一词比例。
- 实验在院系特定语料和整合的全校语料上进行,以评估可扩展性和领域泛化能力。
- 在 20NG 数据集上进行了额外实验,分别使用短(中位数 16 个词)和长(60–100 个词)文档样本,以评估对文档长度的敏感性。
- 通过测量在不同语料中被标记为异常值的文档百分比,量化 HDBSCAN 的异常值检测效果。
- k-Means 变体在 BERTopic 的流程中替代 HDBSCAN,以评估无异常值聚类是否能保持或提升性能。
实验结果
研究问题
- RQ1BERTopic 在包括大学课程评价在内的多样化短文本领域中,是否比 LDA 具有更好的泛化能力?
- RQ2HDBSCAN 的异常值检测在多大程度上损害了 BERTopic 在实际短文本应用中的实用性?
- RQ3文档长度在多大程度上影响 LDA、BERTopic(使用 HDBSCAN)和 BERTopic(使用 k-Means)的性能?
- RQ4k-Means 是否可以作为 BERTopic 中 HDBSCAN 的可行替代方案,而不会牺牲主题连贯性和多样性?
- RQ5聚类算法的选择在多大程度上影响 BERTopic 在全校范围主题建模场景中的可扩展性和可解释性?
主要发现
- 在全校语料上,BERTopic(使用 HDBSCAN)的主题连贯性得分为 0.091,主题多样性得分为 0.880,显著优于 LDA 的连贯性(0.031)和多样性(0.718)。
- HDBSCAN 将 74% 的课程评价回复识别为异常值,严重限制了其在实际应用中的实用性,尽管其连贯性和多样性得分表现强劲。
- BERTopic k-Means 变体在保持高性能的同时,连贯性得分为 0.032,多样性得分为 0.571,且不产生任何异常值,因此更适合包含性分析。
- 与 LDA 和 BERTopic(使用 HDBSCAN)相比,BERTopic k-Means 对短文档更具鲁棒性,表现为长文档与短文档之间主题多样性下降幅度极小(δ = -0.001)。
- 虽然 BERTopic(使用 HDBSCAN)在跨领域泛化方面表现更优,但 BERTopic k-Means 通过保留所有文档并维持可解释性,提供了更具实用性的权衡方案。
- 本研究识别出一个关键的评估指标缺口:目前尚无标准度量能反映异常值生成的影响,而这一影响在实际场景中显著影响模型实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。