Skip to main content
QUICK REVIEW

[论文解读] The Number of Confirmed Cases of Covid-19 by using Machine Learning: Methods and Challenges

Amir Ahmada, Sunita Garhwal|arXiv (Cornell University)|Jun 11, 2020
COVID-19 diagnosis using AI参考文献 27被引用 5
一句话总结

本文提出了一个关于预测新冠肺炎确诊人数的机器学习方法的全面分类法,将这些方法分为四类:基于回归的模型、深度学习方法、社交媒体与搜索查询分析,以及基于网络的建模。文章识别出数据质量、社会污名化和跨国差异等关键挑战,并提出混合模型、迁移学习和多源数据融合以提高预测准确性。

ABSTRACT

Covid-19 is one of the biggest health challenges that the world has ever faced. Public health policy makers need the reliable prediction of the confirmed cases in future to plan medical facilities. Machine learning methods learn from the historical data and make a prediction about the event. Machine learning methods have been used to predict the number of confirmed cases of Covid-19. In this paper, we present a detailed review of these research papers. We present a taxonomy that groups them in four categories. We further present the challenges in this field. We provide suggestions to the machine learning practitioners to improve the performance of machine learning methods for the prediction of confirmed cases of Covid-19.

研究动机与目标

  • 提供用于预测确诊新冠肺炎病例的机器学习方法的系统性分类法。
  • 识别并分析影响这些模型可靠性与可泛化性的主要挑战。
  • 通过跨学科合作与数据融合,提出可操作的建议以提升模型性能。
  • 通过聚焦于确诊病例预测而非更广泛的新冠肺炎AI应用,将本综述与现有文献区分开来。
  • 为研究人员和实践者提供指导,以构建更准确、可迁移且具备情境感知能力的预测系统。

提出的方法

  • 将现有的机器学习方法分类为四种不同的方法论:回归模型、深度学习架构、社交媒体与搜索查询分析,以及基于网络的传播建模。
  • 回顾了85篇以上使用机器学习预测新冠肺炎病例的研究论文,重点分析模型设计、数据来源和评估指标。
  • 提出将机器学习与既有的流行病学框架(如SIR(易感-感染-康复)模型)相结合的混合模型。
  • 倡导使用迁移学习,即将在疫情曲线较成熟的国家数据上训练的模型,适配至处于早期阶段的国家。
  • 建议整合多种数据源(如临床数据、移动模式和在线行为)以增强模型的鲁棒性与泛化能力。
  • 强调在测试率较低或存在较高社会污名化影响病例报告的地区,对情境数据进行适应的重要性。

实验结果

研究问题

  • RQ1用于预测确诊新冠肺炎病例的主要机器学习方法有哪些?它们在结构与性能上如何不同?
  • RQ2哪些与数据相关及系统性的挑战限制了这些模型的准确性与跨国适用性?
  • RQ3将机器学习与流行病学框架相结合的混合模型在多大程度上能提升预测的可靠性?
  • RQ4从疫情曲线较成熟的国家迁移学习,能在多大程度上提升对处于早期阶段国家的预测能力?
  • RQ5在病例数据报告不足或不可靠的地区,可以利用哪些替代数据源?

主要发现

  • 基于回归的模型,尤其是逻辑曲线回归,在短期预测中表现出较高的准确性,但由于饱和假设,长期预测能力有限。
  • 深度学习模型在序列数据上表现强劲,但需要大规模高质量数据集,且对数据分布变化敏感。
  • 社交媒体与搜索查询数据存在噪声,受公众意识影响,而不仅仅是实际传播情况,因此在未校准的情况下其预测能力有限。
  • 基于网络的模型对准确的接触与传播数据依赖性强,但由于对SARS-CoV-2传播动力学理解尚不充分,这些数据仍难以准确量化。
  • 由于文化、人口结构和基础设施差异影响数据收集与传播模式,模型在跨国之间的可迁移性较低。
  • 将机器学习与SIR型流行病学框架相结合的混合模型在提升可解释性与准确性方面展现出巨大潜力,尤其是在结合真实世界数据验证后。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。