[论文解读] Towards using social media to identify individuals at risk for preventable chronic illness
本文提出了一种类游戏的测验,将基于Twitter数据训练的随机森林分类器转化为半自动工具,用于收集个体层面的公共卫生数据。该测验通过与食物和语言相关的问答识别2型糖尿病高风险个体,在BMI分类中达到78.7%的准确率,但由于抽样偏差,超重参与者的性能显著下降。
We describe a strategy for the acquisition of training data necessary to build a social-media-driven early detection system for individuals at risk for (preventable) type 2 diabetes mellitus (T2DM). The strategy uses a game-like quiz with data and questions acquired semi-automatically from Twitter. The questions are designed to inspire participant engagement and collect relevant data to train a public-health model applied to individuals. Prior systems designed to use social media such as Twitter to predict obesity (a risk factor for T2DM) operate on entire communities such as states, counties, or cities, based on statistics gathered by government agencies. Because there is considerable variation among individuals within these groups, training data on the individual level would be more effective, but this data is difficult to acquire. The approach proposed here aims to address this issue. Our strategy has two steps. First, we trained a random forest classifier on data gathered from (public) Twitter statuses and state-level statistics with state-of-the-art accuracy. We then converted this classifier into a 20-questions-style quiz and made it available online. In doing so, we achieved high engagement with individuals that took the quiz, while also building a training set of voluntarily supplied individual-level data for future classification.
研究动机与目标
- 为解决获取个体层面公共卫生数据以预测慢性病风险的挑战,特别是可预防的疾病如2型糖尿病。
- 通过使用非侵入性、类游戏化的测验格式,克服传统健康调查中参与度低和隐私障碍的问题。
- 弥合基于社区的社交媒体分析与基于个体的风险预测之间的差距,实现半自动化的数据收集。
- 开发一种可扩展、低成本的方法,通过社交媒体收集匿名的个体健康数据(例如BMI、人口统计信息)。
- 创建一个公开可用的数据集,用于训练监督分类器,以检测处于可预防慢性病风险中的个体。
提出的方法
- 基于公开的Twitter数据和各州的肥胖统计数据,训练了一个随机森林分类器,用于将美国各州分类为高于或低于平均BMI,其准确率比先前模型高出2%。
- 将训练好的随机森林的决策节点自动转换为自然语言问题,形成类似‘20个问题’的测验。
- 在线部署测验,以自愿、匿名的方式收集参与者的数据,包括自报的体重、身高、年龄、性别和Twitter账号。
- 通过关于食物和与食物相关的语言的间接、有趣的问题,避免隐私顾虑并提高参与度。
- 利用测验结果评估模型性能,并为未来个体层面的分类构建具有代表性的训练数据集。
- 将匿名的测验数据(包括回答、预测结果和人口统计信息)公开用于研究用途。
实验结果
研究问题
- RQ1能否通过从社交媒体分类器衍生出的半自动测验,有效收集高参与度的个体健康数据?
- RQ2在州级社交媒体数据上训练的模型,在多大程度上可迁移用于个体BMI的分类?
- RQ3与传统公共卫生调查相比,基于测验的数据收集方法在参与者参与度方面表现如何?
- RQ4该测验在分类BMI ≥ 28.7(超重状态的阈值)的个体方面表现如何?
- RQ5通过社交媒体上关于食物和语言使用的间接、非侵入性问题,能否以可接受的准确度预测个体BMI?
主要发现
- 该测验在相对于美国平均水平的BMI分类中整体准确率达到78.7%,但该性能严重受样本偏差影响。
- 对于BMI ≥ 28.7的参与者,模型准确率下降至16.0%,表明由于训练数据中代表性不足,对超重个体的检测能力差。
- 研究参与者显著更年轻(26.1岁)、更矮(173厘米)、更轻(74.4公斤),且BMI更低(24.9),而美国成年人的平均值为47.1岁、167厘米、80.3公斤、28.6 BMI。
- 样本偏差如此严重,以至于若对所有参与者均预测为‘非超重’,准确率可达82.3%,凸显了改进数据收集方法的必要性。
- 尽管存在偏差,该测验仍实现了高参与度,945名参与者中有926名自愿提供了BMI、人口统计信息和Twitter账号等补充数据。
- 该测验的匿名数据集(包括回答、预测结果和个人信息)已公开,可供未来研究使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。