Skip to main content
QUICK REVIEW

[论文解读] Author Clustering and Topic Estimation for Short Texts

Graham Tierney, Christopher A. Bail|arXiv (Cornell University)|Jun 15, 2021
Topic Modeling参考文献 39被引用 20
一句话总结

该论文提出了一种新颖的贝叶斯主题模型,通过在文档内建模词共现并利用分层先验在用户间共享主题分布,联合聚类作者并估计短文本中的主题。该方法在主题连贯性和聚类恢复方面优于现有方法,尤其在检测2020年疫情期间美国参议员推文中的党派意识形态方面表现突出。

ABSTRACT

Analysis of short text, such as social media posts, is extremely difficult because of their inherent brevity. In addition to classifying topics of such posts, a common downstream task is grouping the authors of these documents for subsequent analyses. We propose a novel model that expands on the Latent Dirichlet Allocation by modeling strong dependence among the words in the same document, with user-level topic distributions. We also simultaneously cluster users, removing the need for post-hoc cluster estimation and improving topic estimation by shrinking noisy user-level topic distributions towards typical values. Our method performs as well as -- or better -- than traditional approaches, and we demonstrate its usefulness on a dataset of tweets from United States Senators, recovering both meaningful topics and clusters that reflect partisan ideology. We also develop a novel measure of echo chambers among these politicians by characterizing insularity of topics discussed by groups of Senators and provide uncertainty quantification.

研究动机与目标

  • 解决极短文本(如社交媒体帖子)中的主题建模挑战,其中词共现稀疏,传统LDA方法失效。
  • 无需事后聚类,同时聚类作者并估计主题,通过收缩噪声用户级分布来提升主题估计的准确性。
  • 通过分层先验对用户级主题分布建模,捕捉作者间的相似性,增强低数据场景下的鲁棒性。
  • 通过量化用户聚类间的话题封闭性,提出一种衡量回音室效应的新方法,反映意识形态隔离程度。
  • 在2020年疫情初期美国参议员推文的真实数据集上展示该方法的有效性,将聚类结果与已知的意识形态分化关联。

提出的方法

  • 通过为每篇短文本引入文档级主题分配,扩展潜在狄利克雷分配(LDA),以增强同一文档内词语之间的强依赖关系。
  • 在用户级主题分布上引入分层先验,通过跨用户的信息共享稳定稀疏数据中的估计结果。
  • 采用变分贝叶斯推断方法,使模型可扩展至大规模社交媒体语料库,如美国参议员的61,241条推文数据集。
  • 通过用户-主题分布上的狄利克雷过程混合先验聚类用户,实现聚类数量的自动检测。
  • 将不确定性量化整合到主题和聚类估计中,提升下游推断的可靠性。
  • 基于使一个聚类提及所有主题所需推文数量,开发一种衡量话题封闭性的新指标。

实验结果

研究问题

  • RQ1统一模型是否能比两阶段方法更有效地联合估计短文本中的主题并聚类作者?
  • RQ2在稀疏短文本数据中,建模文档内词共现如何提升主题连贯性?
  • RQ3在多大程度上可利用分层先验对用户级主题分布进行聚类,以反映现实世界中的意识形态分组?
  • RQ4该模型能否检测并量化社交媒体政治话语中的意识形态隔离(回音室效应)?
  • RQ5在不同数据条件下,该模型在主题连贯性和聚类恢复方面与最先进方法相比表现如何?

主要发现

  • 在模拟数据中,所提模型的主题连贯性高于stLDA-C和基线方法,甚至略优于真实主题分布。
  • 在聚类恢复模拟中,该模型能正确识别出独立聚类,并仅将仅相差一个主题的聚类合并,其真阳性率(TPR)和假阳性率(FPR)均优于stLDA-C及其他方法。
  • 在美国参议员推文数据集中,该模型成功将参议员聚类为具有意识形态一致性的群体,其中温和共和党人和进步派民主党人形成独立聚类。
  • 模型识别出自由派民主党人和以全国议题为中心的共和党人具有更广泛的话题覆盖范围,但个体民主党人比个体共和党人更快速地覆盖各类话题。
  • 新颖的回音室效应度量显示,个体民主党人比共和党人更早地讨论更广泛的话题范围,表明共和党人具有更高的话题封闭性。
  • 该模型的聚类结果与参议员意识形态的理论衡量标准(如Poole和Rosenthal, 2017)高度一致,证明其在真实政治语境中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。