Skip to main content
QUICK REVIEW

[论文解读] Examining Deep Learning Models with Multiple Data Sources for COVID-19 Forecasting

Lijing Wang, Aniruddha Adiga|arXiv (Cornell University)|Oct 27, 2020
COVID-19 epidemiological studies参考文献 34被引用 6
一句话总结

本文提出了一种基于循环神经网络(RNN)的深度学习模型堆叠集成方法,整合了多个数据源——确诊数、死亡数和检测数据——以提升在县、州和国家层面的每周新冠肺炎新发确诊病例预测性能。通过应用基于聚类的训练方法缓解数据稀疏性和过拟合问题,该方法表现出优越性能,其中简单RNN在高分辨率预测中优于复杂模型(如图神经网络)。

ABSTRACT

The COVID-19 pandemic represents the most significant public health disaster since the 1918 influenza pandemic. During pandemics such as COVID-19, timely and reliable spatio-temporal forecasting of epidemic dynamics is crucial. Deep learning-based time series models for forecasting have recently gained popularity and have been successfully used for epidemic forecasting. Here we focus on the design and analysis of deep learning-based models for COVID-19 forecasting. We implement multiple recurrent neural network-based deep learning models and combine them using the stacking ensemble technique. In order to incorporate the effects of multiple factors in COVID-19 spread, we consider multiple sources such as COVID-19 confirmed and death case count data and testing data for better predictions. To overcome the sparsity of training data and to address the dynamic correlation of the disease, we propose clustering-based training for high-resolution forecasting. The methods help us to identify the similar trends of certain groups of regions due to various spatio-temporal effects. We examine the proposed method for forecasting weekly COVID-19 new confirmed cases at county-, state-, and country-level. A comprehensive comparison between different time series models in COVID-19 context is conducted and analyzed. The results show that simple deep learning models can achieve comparable or better performance when compared with more complicated models. We are currently integrating our methods as a part of our weekly forecasts that we provide state and federal authorities.

研究动机与目标

  • 通过深度学习方法提升多地理分辨率下每周新冠肺炎新发病例的时空预测性能。
  • 通过基于聚类的训练方法,将具有相似流行病趋势的区域分组,以缓解区域时间序列中的数据稀疏性和噪声问题。
  • 评估将确诊数、死亡数和检测数据等多种数据源整合进深度学习模型对提升预测准确性的有效性。
  • 比较深度学习模型、统计模型和机制模型(如SEIR)在预测新冠肺炎传播动态方面的性能表现。
  • 确定在高分辨率、长期预测中,更简单的深度学习架构(如RNN)是否优于更复杂的模型(如GNN)

提出的方法

  • 该框架采用基于RNN的深度学习模型堆叠集成方法,利用多个数据源(确诊数、死亡数和检测数据)进行训练。
  • 应用基于聚类的训练方法,根据趋势相似性对空间区域进行分组,使在地理和流行病学上相似的区域共享模型学习,从而减少过拟合。
  • 评估了三种聚类方法:地理聚类(geo)、k-means和k-shape;k-shape聚类能捕捉长期趋势相似性,而geo聚类反映短期局部动态。
  • 通过堆叠方法整合各独立模型的预测结果,提升在不同预测时长下的泛化能力和鲁棒性。
  • 特征工程包括使用多种输入特征以及注意力层,以建模不同数据源之间的相互依赖关系。
  • 使用RMSE、MAPE和皮尔逊相关系数(PCORR)在全局、州和县级数据集上评估模型性能。

实验结果

研究问题

  • RQ1整合多种数据源(病例数、死亡数、检测数据)是否能提升基于深度学习的新冠肺炎预测模型的准确性?
  • RQ2基于聚类的训练是否能增强模型在数据稀疏且噪声较大的区域中的泛化能力并减少过拟合?
  • RQ3在高分辨率预测中,简单RNN与更复杂的深度学习模型(如GRU、LSTM和图神经网络)相比性能如何?
  • RQ4与统计模型和机制模型(如AR、SEIR)相比,深度学习模型在预测每周新发确诊病例方面的相对表现如何?
  • RQ5在不同预测时长下,哪种聚类方法(geo、k-means、k-shape)能获得最佳预测性能?

主要发现

  • 基于多源数据的RNN模型堆叠集成在所有预测时长和地理层级上均表现出最佳整体性能。
  • 在县和州层面的1周预测中,简单RNN优于GRU和LSTM等更复杂模型,表明在数据稀缺条件下,模型简洁性有助于提升泛化能力。
  • 在3周和4周预测中,GRU和LSTM优于RNN,表明长期预测更受益于更复杂的记忆机制。
  • 整合多特征(病例数、死亡数、检测数据)的模型比单特征模型预测更准确,尤其在州和县层面表现更优,但全球预测仍具挑战性,主要因检测数据缺失。
  • k-shape聚类在3周和4周预测中表现最佳,而geo聚类在1周和2周预测中表现最优,表明不同聚类策略可捕捉不同的时间动态。
  • 集成模型显著优于单个模型、经典机器学习模型和最先进的深度学习模型,证明了在流行病预测中模型堆叠的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。