[论文解读] Predicting the Flu from Instagram
本研究提出了一套机器学习流程,利用公开的Instagram数据(包括文本、标签和通过深度卷积神经网络提取的图像内容),对芬兰的流感样疾病(ILI)病例进行实时监测和预测。基于317周的数据,最佳模型在实时监测中的平均绝对误差为11.33,相关系数为0.963,表明社交媒体中的视觉内容能显著提升流行病学信息学中的预测准确性。
Conventional surveillance systems for monitoring infectious diseases, such as influenza, face challenges due to shortage of skilled healthcare professionals, remoteness of communities and absence of communication infrastructures. Internet-based approaches for surveillance are appealing logistically as well as economically. Search engine queries and Twitter have been the primarily used data sources in such approaches. The aim of this study is to assess the predictive power of an alternative data source, Instagram. By using 317 weeks of publicly available data from Instagram, we trained several machine learning algorithms to both nowcast and forecast the number of official influenza-like illness incidents in Finland where population-wide official statistics about the weekly incidents are available. In addition to date and hashtag count features of online posts, we were able to utilize also the visual content of the posted images with the help of deep convolutional neural networks. Our best nowcasting model reached a mean absolute error of 11.33 incidents per week and a correlation coefficient of 0.963 on the test data. Forecasting models for predicting 1 week and 2 weeks ahead showed statistical significance as well by reaching correlation coefficients of 0.903 and 0.862, respectively. This study demonstrates how social media and in particular, digital photographs shared in them, can be a valuable source of information for the field of infodemiology.
研究动机与目标
- 评估Instagram数据(尤其是其视觉内容)在监测和预测流感样疾病(ILI)病例方面的预测能力。
- 解决传统监测系统存在的局限性,如医疗人员短缺和偏远地区基础设施不足的问题。
- 探究深度学习模型是否能有效从Instagram图像和文本中提取流行病学相关的信号。
- 在实时监测(当前周估计)和预测(1–2周预测)官方ILI统计数据方面,比较多种机器学习算法的表现。
提出的方法
- 收集了芬兰317周的公开Instagram数据,重点关注包含芬兰语中与流感相关关键词的帖子。
- 提取时间特征(日期)、文本特征(标签数量),并使用预训练的深度卷积神经网络(ResNet-50)从图像内容中提取视觉特征。
- 通过4张参考图像(如咳嗽、发烧、流感症状)进行图像相似性搜索,以识别并提取用户帖子中的相关视觉模式。
- 训练并比较了9种机器学习模型,包括XGBoost、LightGBM和LSTM网络,用于实时监测和预测任务。
- 使用皮尔逊相关系数和平均绝对误差(MAE)作为评估指标,在测试数据上评估模型性能。
- 进行特征重要性分析,量化视觉特征相对于其他输入特征的贡献,结果显示视觉内容对预测的贡献占比为12.1%。
实验结果
研究问题
- RQ1能否有效利用Instagram公开的图像和文本数据,来预测一个拥有可靠监测数据的国家的实际流感样疾病(ILI)发病率?
- RQ2与仅使用文本和时间特征相比,通过深度学习提取的Instagram图像视觉特征在多大程度上提升了ILI预测模型的准确性?
- RQ3在实时监测和ILI病例的短期预测中,图像内容的引入如何影响机器学习模型的性能?
- RQ4在单一语言(芬兰语)和单一国家(芬兰)数据上训练的模型是否具有跨区域泛化能力?该方法存在哪些局限性?
主要发现
- 最佳实时监测模型的平均绝对误差(MAE)为每周11.33例,与官方ILI数据的相关系数为0.963。
- 1周和2周预测的预测模型分别实现了0.903和0.862的相关系数,表明具有统计显著性。
- 引入图像特征后,测试MAE从13.83降低至11.33,表明视觉内容带来了可测量的性能提升。
- 特征重要性分析显示,图像特征对整体预测能力的贡献占比为12.1%。
- 使用有限的4张参考图像进行图像相似性搜索,表明若采用更大、更丰富的参考图像集,性能可能进一步提升。
- 本研究首次证明了在社交媒体图像上应用深度学习进行流感疫情预测的可行性,为流行病学信息学开辟了新颖的数据来源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。