Skip to main content
QUICK REVIEW

[论文解读] Comparing and Integrating US COVID-19 Daily Data from Multiple Sources: A County-Level Dataset with Local Characteristics

G Wang, Gu Z|arXiv (Cornell University)|Jun 1, 2020
COVID-19 epidemiological studies参考文献 5被引用 6
一句话总结

本研究对比并整合了来自四大主要来源的每日美国新冠肺炎病例数据——《纽约时报》、约翰霍普金斯大学、《大西洋》杂志的新冠肺炎追踪项目以及USAFacts,同时解决了报告延迟、依赖顺序违规和异常值等数据质量问题。研究生成了一个统一的、按县划分的数据集,整合了本地社会经济、人口统计和医疗基础设施特征,以提升公共卫生研究与政策分析的水平。

ABSTRACT

Over the past several months, the outbreak of COVID-19 has been expanding over the world. A reliable and accurate dataset of the cases is vital for scientists to conduct related research and for policy-makers to make better decisions. We collect the COVID-19 daily reported data from four open sources: the New York Times, the COVID-19 Data Repository by Johns Hopkins University, the COVID Tracking Project at the Atlantic, and the USAFacts, and compare the similarities and differences among them. In addition, we examine the following problems which occur frequently: (1) the order dependencies violation, (2) the delay-reported issue on weekends and/or holidays, and (3) abnormal data point or data period. We also integrate the COVID-19 reported cases with the county-level auxiliary information of the local features from official sources, such as health infrastructure, demographic, socioeconomic, and environment information, which are important for understanding the spread of the virus.

研究动机与目标

  • 解决多个公开新冠肺炎数据集中的不一致性和数据质量问题,例如周末报告延迟、依赖顺序违规以及异常数据点。
  • 整合县级辅助数据,包括人口统计、社会经济、医疗基础设施和环境因素,以增强对病毒传播背景的理解。
  • 为研究人员和政策制定者创建一个可靠、协调一致且全面的县级数据集,以支持疫情期间基于证据的决策。
  • 通过识别并解决县级层面上每日病例报告中的差异,确保跨数据源的数据一致性和准确性。
  • 提供一个标准化的、开放获取的数据集,支持在精细地理分辨率下对SARS-CoV-2传播动态进行纵向和横断面分析。

提出的方法

  • 从四个开放获取来源汇总每日确诊病例数:《纽约时报》、约翰霍普金斯大学的新冠肺炎数据仓库、《大西洋》杂志的新冠肺炎追踪项目以及USAFacts。
  • 应用数据协调技术,通过检测和纠正报告异常值(包括依赖顺序违规和周末/节假日延迟报告)来解决差异。
  • 实施时间对齐流程,以标准化报告日期,并纠正不同来源之间病例更新的不一致性。
  • 从美国联邦政府官方来源整合县级辅助数据,包括美国人口普查局、疾病控制与预防中心(CDC)以及美国社区调查,以丰富病例数据的本地特征。
  • 使用地理编码和基于FIPS的匹配方法,将病例数据与县级层面的人口统计、社会经济和医疗基础设施指标对齐。
  • 应用数据验证启发式规则,以标记并纠正异常数据点,如负病例数或明显不合理的单日大幅增长。

实验结果

研究问题

  • RQ1在县级层面上,四个主要美国数据源的每日报告病例数在一致性和准确性方面如何比较?
  • RQ2周末和节假日的报告延迟在多大程度上影响了各数据源每日病例数据的可靠性?
  • RQ3在四个数据源中,最常见的数据质量问题(如依赖顺序违规和异常数据点)是什么?
  • RQ4如何通过整合病例数据与本地社会经济、人口统计及医疗基础设施特征,构建一个协调一致的县级数据集?
  • RQ5数据整合与质量校正对SARS-CoV-2传播纵向和空间分析的可靠性有何影响?

主要发现

  • 在四个数据源之间发现了显著差异,特别是在周末和节假日期间,这主要由于报告延迟和不一致的更新模式所致。
  • 在多个数据源中识别出依赖顺序违规现象(即后续报告的病例被记录在更早报告的病例之前),尤其在疫情初期阶段更为明显。
  • 在所有数据源中均检测到异常数据点(如负病例数或明显不合理的单日大幅增长),且在较少经过校对的数据集中出现频率更高。
  • 整合县级辅助数据(包括医疗基础设施和社会经济指标)显著增强了最终数据集在流行病学分析中的背景信息丰富度。
  • 在应用数据质量校正程序后,协调一致的数据集表现出更优的时间一致性并减少了噪声,从而提升了研究使用的可靠性。
  • 最终数据集提供了一个统一的、按县划分的SARS-CoV-2病例视图,整合了20多个本地特征,使对传播驱动因素的更细致分析成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。