[论文解读] Crowdsourcing Health Labels: Inferring Body Weight from Profile Pictures
本文提出一种众包方法,从社交媒体个人资料图片中推断体重状况(超重/正常),证明此类标签可被可靠提取,并与县一级的肥胖率相关。关键贡献在于表明个人资料图片可实现个体层面的健康标签标注,揭示了行为差异,例如在高肥胖率地区,超重用户拥有更少的关注者。
To use social media for health-related analysis, one key step is the detection of health-related labels for users. But unlike transient conditions like flu, social media users are less vocal about chronic conditions such as obesity, as users might not tweet "I'm still overweight". As, however, obesity-related conditions such as diabetes, heart disease, osteoarthritis, and even cancer are on the rise, this obese-or-not label could be one of the most useful for studies in public health. In this paper we investigate the feasibility of using profile pictures to infer if a user is overweight or not. We show that this is indeed possible and further show that the fraction of labeled-as-overweight users is higher in U.S. counties with higher obesity rates. Going from public to individual health analysis, we then find differences both in behavior and social networks, for example finding users labeled as overweight to have fewer followers.
研究动机与目标
- 探究社交媒体个人资料图片是否可用于推断个体的体重状况,特别是针对在自我报告中被低估的慢性疾病(如肥胖)。
- 评估通过图像分析标记为超重的用户分布是否与现实中的县一级肥胖统计数据一致。
- 在控制区域肥胖率后,检查被标记为超重与非超重用户在个体层面的行为和网络结构差异。
- 通过利用个人资料图片中的非语言视觉线索,解决文本自我披露中存在的召回率低和偏差问题。
- 为未来基于社交媒体数据在个体层面开展公共卫生研究奠定基础,尤其针对体重相关污名化和行为的研究。
提出的方法
- 采用两阶段众包流程,由人工标注员基于视觉评估对个人资料图片进行‘超重’或‘非超重’的标注。
- 研究聚焦于111个美国县——73个肥胖率较高(≥38.5%)和43个肥胖率较低(<19.5%)——以比较不同区域的标注结果。
- 通过Followerwonk使用地理位置字符串匹配(如“Greene, AL”)收集推特用户数据,筛选条件包括活跃度(≥10条推文、关注者、好友)和个人资料图片可用性。
- 使用Twitter REST API检索个人资料数据,并筛选掉微型名人(关注者或好友≤1,000人)和不活跃用户。
- 构建统计模型,按县肥胖率分层分析超重与非超重用户在关注者数量和网络行为上的差异。
- 分析包括带有交互项的回归模型,以检验在不同地区,被标记为超重对关注者数量的影响是否存在差异。
实验结果
研究问题
- RQ1Q1:能否从个人的社交媒体个人资料图片中推断其是否超重?
- RQ2Q2:通过图像分析标记为超重的用户分布是否与县一级的线下肥胖统计数据一致?
- RQ3在控制区域肥胖率后,被标记为超重与非超重用户在社交媒体行为和网络结构上是否存在差异?
- RQ4即使考虑用户活跃度和网络规模,超重用户的标记是否仍与区域肥胖流行率相关?
- RQ5超重用户是否更难积累关注者,且这种效应是否因地区而异?
主要发现
- 本研究成功通过众包从个人资料图片中推断体重状况,且标记为超重的用户比例与县一级肥胖率之间存在显著正相关关系。
- 在高肥胖率县,被标记为超重的用户平均比非超重用户少约40个关注者,该差异具有统计学显著性(p < 0.01)。
- 在预测关注者数量的回归模型中,加入‘是否超重’标签后,R²值略有提升,表明存在可测量的行为效应。
- 模型显示,在高肥胖率地区,被标记为超重对关注者数量的负面影响更为显著,表明社会网络动态存在区域差异。
- 标注过程达到了足够的可靠性,使个体层面分析成为可能,克服了纯文本自我披露中召回率低和自我报告偏差的局限。
- 结果支持利用社交媒体视觉数据开展公共卫生研究的可行性,尤其适用于大规模研究肥胖相关行为和污名化问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。