Skip to main content
QUICK REVIEW

[论文解读] Retweet-BERT: Political Leaning Detection Using Language Features and Information Diffusion on Social Networks

Julie Jiang, Xiang Ren|arXiv (Cornell University)|Jul 18, 2022
Misinformation and Its Impacts被引用 7
一句话总结

Retweet-BERT 是一种可扩展的无监督模型,通过结合用户个人资料描述的 BERT 嵌入与转发网络结构,预测 Twitter 用户的政治倾向,在两个近期数据集上实现了 96–97% 的宏平均 F1 分数;该模型揭示了非对称的回音室效应,右倾用户在新冠疫情讨论中表现出更强的极化现象。

ABSTRACT

Estimating the political leanings of social media users is a challenging and ever more pressing problem given the increase in social media consumption. We introduce Retweet-BERT, a simple and scalable model to estimate the political leanings of Twitter users. Retweet-BERT leverages the retweet network structure and the language used in users' profile descriptions. Our assumptions stem from patterns of networks and linguistics homophily among people who share similar ideologies. Retweet-BERT demonstrates competitive performance against other state-of-the-art baselines, achieving 96%-97% macro-F1 on two recent Twitter datasets (a COVID-19 dataset and a 2020 United States presidential elections dataset). We also perform manual validation to validate the performance of Retweet-BERT on users not in the training data. Finally, in a case study of COVID-19, we illustrate the presence of political echo chambers on Twitter and show that it exists primarily among right-leaning users. Our code is open-sourced and our data is publicly available.

研究动机与目标

  • 开发一种可扩展的、无需标注的 Twitter 政治意识形态估计方法,结合语言特征与网络特征。
  • 研究信息传播模式与语言同质性如何与社交媒体上的政治极化相关联。
  • 分析在 2020 年美国总统大选和新冠疫情等高影响力事件期间,政治回音室的存在与结构特征。
  • 通过人工评估与案例研究,验证模型在未见用户上的性能表现。
  • 提供开源代码与公开数据,以支持可复现性及在线极化现象的进一步研究。

提出的方法

  • 在用户个人资料描述上微调 BERT,以提取反映意识形态、情感和归属感的上下文嵌入。
  • 构建一个转发网络,其中边代表转发行为,权重 ≥2 以确保有意义的推荐信号。
  • 对结合后的个人资料与网络数据进行无监督预训练,学习联合用户表征。
  • 在小规模启发式标注子集上微调模型,使用来自 AllSides.com 的标签和媒体偏见评分。
  • 采用逻辑回归并进行超参数调优,基于学习到的嵌入对政治极性进行分类。
  • 采用 node2vec 和 GraphSAGE 作为基线模型进行对比,保持一致的训练与评估协议。

实验结果

研究问题

  • RQ1语言同质性与转发网络结构是否能共同提升 Twitter 上政治倾向检测的性能?
  • RQ2Retweet-BERT 在近期大规模 Twitter 数据集上的表现相较于最先进模型如何?
  • RQ3政治回音室在多大程度上形成?其在左倾与右倾用户之间是否存在非对称性?
  • RQ4Retweet-BERT 在泛化到训练数据中未包含的用户时,其有效性如何,经人工评估验证?
  • RQ5在新冠疫情等高影响力事件期间,政治极化群体中的信息传播模式呈现出何种特征?

主要发现

  • Retweet-BERT 在新冠疫情 Twitter 数据集上达到 96% 的宏平均 F1 分数,在 2020 年美国总统大选数据集上达到 97% 的宏平均 F1 分数,优于最先进基线模型。
  • 该模型展现出强大的泛化能力,人工验证确认其在训练数据外用户上的表现可靠。
  • 右倾用户表现出显著更强的回音室效应,其转发网络更紧密聚集,同质性更高。
  • 左倾用户表现出更广泛的信息接触,表明其转发网络中结构性隔离程度较低。
  • 政治回音室在右倾用户中最为显著,尤其是在新冠疫情讨论期间。
  • 启发式标注的标签与 AllSides.com 提供的媒体偏见评分能有效实现无人工标注数据的伪标签化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。