Skip to main content
QUICK REVIEW

[论文解读] Flu Detector: Estimating influenza-like illness rates from online user-generated content

Vasileios Lampos|arXiv (Cornell University)|Dec 11, 2016
Data-Driven Disease Surveillance参考文献 17被引用 4
一句话总结

Flu Detector 是一个在线平台,利用谷歌搜索和推特数据估算英格兰流感样疾病(ILI)发病率,通过先进的统计自然语言处理模型推断实时疾病趋势。其准确度很高,在四个流感季节中,平均绝对误差为每10万人1.5例,与官方RCGP监测数据的相关系数达0.95。

ABSTRACT

We provide a brief technical description of an online platform for disease monitoring, titled as the Flu Detector (fludetector.cs.ucl.ac.uk). Flu Detector, in its current version (v.0.5), uses either Twitter or Google search data in conjunction with statistical Natural Language Processing models to estimate the rate of influenza-like illness in the population of England. Its back-end is a live service that collects online data, utilises modern technologies for large-scale text processing, and finally applies statistical inference models that are trained offline. The front-end visualises the various disease rate estimates. Notably, the models based on Google data achieve a high level of accuracy with respect to the most recent four flu seasons in England (2012/13 to 2015/16). This highlighted Flu Detector as having a great potential of becoming a complementary source to the domestic traditional flu surveillance schemes.

研究动机与目标

  • 开发一个实时、公开可访问的系统,用于监测英格兰流感样疾病(ILI)发病率,利用在线用户生成内容。
  • 通过先进的自然语言处理技术,提升模型准确性和可靠性,克服以往系统(如谷歌流感趋势)的局限性。
  • 提供一种互补的、数据驱动的公共卫生监测工具,与传统症状监测系统整合。
  • 与英国公共卫生署(PHE)合作评估该平台性能,评估其潜在整合进国家流感监测报告的可能性。
  • 在后续工作中扩展系统功能,包括区域估计、人口统计分层,以及支持多种传染病。

提出的方法

  • Flu Detector 从推特的流媒体API和私有的谷歌健康趋势API实时获取数据,使用来自英格兰的地理标记搜索查询和推文。
  • 应用基于历史RCGP报告的ILI发病率训练的监督学习模型,使用词袋和神经词嵌入表示文本数据。
  • 系统以每周为单位处理数据,与官方监测报告周期对齐,每个估计值使用过去7天的搜索频率和推文频率。
  • 对于推特数据,模型应用于一小部分(约1–2%)的地理定位推文,导致估计值存在噪声,但通过平滑处理以提升用户可视化效果。
  • 统计推断模型在离线状态下训练,并用于生成每日和每周的ILI发病率估计,性能通过与RCGP数据对比进行验证。
  • 平台使用Apache Hadoop进行分布式文本处理,使用标准Python库(如gensim、nltk、numpy)进行自然语言处理和数值计算。

实验结果

研究问题

  • RQ1能否从英国的谷歌搜索和推特数据中准确生成流感样疾病(ILI)发病率的实时估计?
  • RQ2基于谷歌搜索的模型在相关性和误差方面与传统监测数据相比表现如何?
  • RQ3与早期系统(如谷歌流感趋势)相比,增强自然语言处理的模型能否提高在线疾病监测的可靠性和准确性?
  • RQ4社交媒体和搜索引擎的用户生成内容在多大程度上可作为国家公共卫生监测的互补指标?
  • RQ5由于数据量低,基于推特的ILI估计存在哪些局限性?平滑技术在多大程度上可缓解这些问题?

主要发现

  • 基于谷歌搜索的模型在四个流感季节(2012/13至2015/16)中估算每周ILI发病率时,平均绝对误差为每10万人1.5例。
  • 谷歌搜索模型与官方RCGP ILI监测数据的皮尔逊相关系数为0.95,表明与真实情况高度一致。
  • 基于推特的模型因数据量低(地理定位推文的1–2%)而产生较不稳定的估计,但经平滑处理后显著提升了可用性。
  • 该平台成功证明了其作为传统监测系统补充工具的可行性,评估结果支持其潜在整合进PHE的每周流感报告。
  • 该系统通过利用现代自然语言处理技术(包括神经词嵌入)改进特征表示和模型泛化能力,表现优于早期模型。
  • 该平台是首个为英格兰提供基于谷歌搜索的ILI估计的系统,填补了谷歌流感趋势停用后留下的空白。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。