Skip to main content
QUICK REVIEW

[论文解读] Social Media Image Analysis for Public Health

Kiran Garimella, Abdulrahman Alfayad|arXiv (Cornell University)|Dec 14, 2015
Data-Driven Disease Surveillance参考文献 24被引用 9
一句话总结

本研究探讨了使用用户提供的标签和机器生成的图像标签的地理标记Instagram图片,是否能够预测县级层面的公共卫生统计数据。研究发现,尽管用户标签通常优于机器生成标签,但像'liquid'和'glass'这样的机器生成标签在预测过度饮酒方面表现更优,表明机器生成标签可揭示文本中无法体现的、与耻辱感相关的健康行为。

ABSTRACT

Several projects have shown the feasibility to use textual social media data to track public health concerns, such as temporal influenza patterns or geographical obesity patterns. In this paper, we look at whether geo-tagged images from Instagram also provide a viable data source. Especially for "lifestyle" diseases, such as obesity, drinking or smoking, images of social gatherings could provide information that is not necessarily shared in, say, tweets. In this study, we explore whether (i) tags provided by the users and (ii) annotations obtained via automatic image tagging are indeed valuable for studying public health. We find that both user-provided and machine-generated tags provide information that can be used to infer a county's health statistics. Whereas for most statistics user-provided tags are better features, for predicting excessive drinking machine-generated tags such as "liquid" and "glass" yield better models. This hints at the potential of using machine-generated tags to study substance abuse.

研究动机与目标

  • 评估地理标记的Instagram图片是否可作为公共卫生监测的可行数据源。
  • 比较用户提供的标签与通过深度学习生成的机器标签在预测县级健康统计数据方面的预测能力。
  • 评估自动图像标记是否能揭示用户未明确标注的与健康相关的行为,特别是像物质滥用等耻辱性状况。
  • 探讨利用视觉数据研究肥胖、饮酒和身体活动不足等生活方式疾病的可能性。

提出的方法

  • 本研究使用美国各县的地理标记Instagram图片,提取用户提供的标签和通过Imagga API生成的机器标签。
  • 采用回归模型,结合图像标签和人口统计数据(如种族、收入、教育水平)来预测县级健康统计数据。
  • 通过皮尔逊相关系数(r)和平均绝对误差(MAE)评估模型性能,比较包含和不包含图像标签的模型表现。
  • 通过计算单个标签与健康结果之间的绝对相关性,分析特征重要性,以识别最具预测性的视觉线索。
  • 在县级数据集上训练和测试模型,并采用交叉验证以确保结果稳健。
  • 使用基于深度学习的图像识别技术(如卷积神经网络)从图像内容生成标签,例如'liquid'、'beverage'和'glass'。

实验结果

研究问题

  • RQ1用户在地理标记的Instagram图片上提供的标签,是否比仅使用人口统计数据更能准确预测县级公共卫生统计数据?
  • RQ2通过深度学习模型生成的机器标签,是否在公共卫生指标的预测中提供了超越用户标签的额外预测能力?
  • RQ3在哪些健康结果上——尤其是像过度饮酒等耻辱性行为——机器生成标签优于用户提供的标签?
  • RQ4哪些具体的视觉概念(例如'glass'、'liquid')在图像数据中对物质滥用指标最具预测性?
  • RQ5基于图像的特征是否能揭示文本社交媒体数据中未捕捉到的生活方式疾病相关行为模式?

主要发现

  • 对于大多数健康统计数据,使用用户提供的标签的模型优于仅使用人口统计数据的模型,皮尔逊相关系数(r)的提升范围为0.46至0.84。
  • 在过度饮酒的预测中,机器生成的标签如'liquid'、'beverage'和'glass'显著优于用户提供的标签,皮尔逊相关系数达到0.48,而仅使用用户标签时为0.22。
  • 使用机器生成标签的模型在过度饮酒预测中的平均绝对误差(MAE)为5.2,而使用用户标签的模型为6.2,表明预测精度更高。
  • 用户提供的标签如'#fatgirlstatus'与身体活动不足高度相关,表明自我指涉性语言可反映生活方式行为。
  • 在用户不太可能自我标识的耻辱性行为(如物质使用)中,机器生成标签尤为有效,因其能捕捉到隐含的视觉线索。
  • 特征分析显示,'meeting'和'party'等标签与过度饮酒有强烈相关性,表明社交情境可通过自动标记技术被捕捉到。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。