Skip to main content
QUICK REVIEW

[论文解读] Predicting the Topical Stance of Media and Popular Twitter Users

Peter Stefanov, Kareem Darwish|arXiv (Cornell University)|Jul 2, 2019
Media Influence and Politics参考文献 40被引用 9
一句话总结

本文提出一种级联方法,通过基于转发行为的无监督立场检测,随后结合情感值、图嵌入和上下文嵌入的监督分类,预测媒体机构和主流Twitter用户的政治倾向与话题立场。该方法在预测媒体偏见方面达到82.6%的准确率,其中情感值成为最有效的特征。

ABSTRACT

Discovering the stances of media outlets and influential people on current, debatable topics is important for social statisticians and policy makers. Many supervised solutions exist for determining viewpoints, but manually annotating training data is costly. In this paper, we propose a cascaded method that uses unsupervised learning to ascertain the stance of Twitter users with respect to a polarizing topic by leveraging their retweet behavior; then, it uses supervised learning based on user labels to characterize both the general political leaning of online media and of popular Twitter users, as well as their stance with respect to the target polarizing topic. We evaluate the model by comparing its predictions to gold labels from the Media Bias/Fact Check website, achieving 82.6% accuracy.

研究动机与目标

  • 自动推断媒体和有影响力的Twitter用户的政治倾向与话题立场,无需人工标注。
  • 解决立场检测与媒体偏见分类中训练数据人工标注成本过高的问题。
  • 利用转发行为作为对极化话题用户立场的代理指标,实现在大规模数据上的无监督聚类。
  • 结合情感值、图嵌入和基于BERT的上下文嵌入等多种特征,提升偏见预测性能。
  • 将模型结果与Media Bias/Fact Check提供的黄金标准标签及对Twitter用户的独立人工判断进行验证。

提出的方法

  • 通过分析用户在极化话题上的转发行为,对Twitter用户实施无监督立场检测,利用UMAP和均值漂移算法将用户聚类为对立群体。
  • 通过在自动发现的立场标签上训练的监督学习方法扩展用户聚类,以提升覆盖范围。
  • 通过计算来自左倾和右倾聚类的转发比例,将用户立场映射至媒体和Twitter意见领袖。
  • 使用情感值分数、用户-话题标签网络和用户-提及网络的图嵌入,以及文章标题和内容的BERT嵌入组合,训练监督分类器。
  • 采用node2vec生成图嵌入,并对tweet和文章文本微调BERT模型以提取上下文表征。
  • 在堆叠模型中整合所有特征,结合早停和交叉验证策略,以优化偏见预测性能。

实验结果

研究问题

  • RQ1转发行为能否可靠地用于推断Twitter用户在极化话题上的政治立场?
  • RQ2与图嵌入和上下文嵌入相比,情感值在预测媒体偏见方面有多高效?
  • RQ3结合多种嵌入类型在多大程度上提升了媒体偏见预测的准确性?
  • RQ4能否通过监督学习有效扩展无监督用户聚类,从而将立场检测扩展至大规模用户群体?
  • RQ5该模型在独立来源(如Media Bias/Fact Check)提供的真实世界媒体偏见标签上表现如何?

主要发现

  • 当结合情感值、图嵌入(GraphM+H)以及来自tweet、标题和内容的BERT嵌入时,所提方法在预测媒体偏见方面达到82.6%的准确率。
  • 仅使用情感值即获得75.2%的准确率,显著优于单独的BERT或图嵌入模型(准确率范围为60.6%至71.8%)。
  • 从完整模型中移除情感值将准确率降低4.5个百分点(降至78.1%),并使MAE增加0.078,表明其关键作用。
  • 将BERT(基于文章内容)与图嵌入及情感值结合,准确率提升至80.8%,表明信息具有互补性。
  • 图嵌入单独使用时表现不如情感值,但与情感值和BERT结合后,性能最高可提升11个百分点。
  • 模型在主流Twitter用户上的表现经人工判断验证,证实其在意见领袖立场检测中的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。