Skip to main content
QUICK REVIEW

[论文解读] The geographic spread of COVID-19 correlates with the structure of social networks as measured by Facebook

Theresa Kuchler, Dominic Russel|arXiv (Cornell University)|Apr 7, 2020
COVID-19 epidemiological studies被引用 11
一句话总结

本文利用聚合的 Facebook 社交网络数据表明,与早期 COVID-19 热点地区(如纽约州威彻斯特县和意大利洛迪)社会联系更紧密的地区,在2020年3月下旬经历了显著更高的确诊病例数,即使在控制了物理距离、人口密度和人口统计因素后依然如此。基于 Facebook 友谊关系推导出的社会连通性指数(SCI)在疫情预测方面优于传统指标(如物理邻近性)、智能手机位置数据(LEX)和 Google 搜索趋势,尤其在缺乏此类数据的地区表现更优。

ABSTRACT

We use aggregated data from Facebook to show that COVID-19 is more likely to spread between regions with stronger social network connections. Areas with more social ties to two early COVID-19 "hotspots" (Westchester County, NY, in the U.S. and Lodi province in Italy) generally had more confirmed COVID-19 cases by the end of March. These relationships hold after controlling for geographic distance to the hotspots as well as the population density and demographics of the regions. As the pandemic progressed in the U.S., a county's social proximity to recent COVID-19 cases and deaths predicts future outbreaks over and above physical proximity and demographics. In part due to its broad coverage, social connectedness data provides additional predictive power to measures based on smartphone location or online search data. These results suggest that data from online social networks can be useful to epidemiologists and others hoping to forecast the spread of communicable diseases such as COVID-19.

研究动机与目标

  • 评估通过 Facebook 友谊关系衡量的社会网络结构是否能够预测 COVID-19 的地理传播。
  • 评估社会连通性相对于物理邻近性、人口统计因素以及其他数字代理指标(如智能手机位置和症状搜索数据)的预测能力。
  • 证明社会连通性指数(SCI)作为一种可扩展、高覆盖度的工具,在流行病学建模中用于预测疾病暴发的实用性。
  • 突出社交网络数据在 GPS 或搜索数据不可用或有限的地区中的优势。

提出的方法

  • 作者基于美国各县与意大利省份之间的去标识化、聚合的 Facebook 友谊数据构建了社会连通性指数(SCI)。
  • SCI 衡量的是某一地区 Facebook 用户与另一地区用户成为朋友的概率,作为现实世界人际互动的代理指标。
  • 本研究使用回归模型检验社会邻近性是否能预测早期热点地区附近的未来病例增长,同时控制地理距离、人口密度和人口统计变量。
  • 作者通过包含和不包含 SCI 的模型进行样本内和样本外预测检验,使用均方根误差(RMSE)评估预测准确性。
  • 他们将 SCI 的预测能力与两个既有的代理指标进行比较:来自智能手机移动性的位置暴露指数(LEX)和 Google 对 COVID-19 症状的搜索量。
  • 分析涵盖病例和死亡数据,分别基于数据可得性训练模型,以确保现实的样本外预测。

实验结果

研究问题

  • RQ1作为 Facebook 友谊关系衡量的区域间社会连通性,是否能预测更高的 COVID-19 传播率?
  • RQ2社会连通性在多大程度上能提升疫情预测能力,超越物理邻近性和人口统计控制?
  • RQ3社会连通性的预测能力与智能手机位置数据(LEX)和 Google 症状搜索趋势相比如何?
  • RQ4在缺乏 LEX 或 Google 数据的地区,社会连通性是否能显著提高预测准确性?
  • RQ5在数据稀缺的地区(如农村或国际地区),社交网络数据能否提供可靠且高覆盖度的预测?

主要发现

  • 在两个星期内,一个县与病例区域的社会邻近性每翻倍一次,其未来两周内的本地确诊病例数平均增加 24.9%,即使在控制了物理邻近性和人口统计因素后依然显著。
  • 与死亡病例的社会邻近性同样能预测未来的死亡人数,表明该效应并非由检测或报告差异引起。
  • 在同时拥有 LEX 和 Google 数据的县中,社会连通性仅带来微小的增量预测价值,这与预期一致,因为其底层机制(即现实世界移动)存在重叠。
  • 然而,在包含所有美国县(包括无 LEX 或 Google 数据的县)的完整样本中,加入病例的社会邻近性显著降低了预测误差(RMSE),凸显了其数据可及性的优势。
  • 在 14 个预测周期中的 10 个周期内,当在最优可用模型框架中使用 SCI 时,其表现优于基线模型,尤其在数据稀缺地区表现更优。
  • SCI 可覆盖 3,141 个美国县,而 Google 数据覆盖 2,572 个县,LEX 数据覆盖 2,018 个县,表明其具有更广泛的地理覆盖范围。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。