Skip to main content
QUICK REVIEW

[论文解读] Yoga-Veganism: Correlation Mining of Twitter Health Data

Tunazzina Islam|arXiv (Cornell University)|Jun 15, 2019
Eating Disorders and BehaviorsPsychology被引用 18
一句话总结

本研究对40,000条与健康相关的Twitter推文应用主题建模(LSA、NMF、LDA),以揭示生活方式行为中的隐藏模式与关联。研究发现瑜伽与纯素饮食之间存在显著相关性,模型训练准确率达66%,测试准确率达51%,并通过LIME提升了模型可解释性,以供未来对误导性预测的分析。

ABSTRACT

Nowadays social media is a huge platform of data. People usually share their interest, thoughts via discussions, tweets, status. It is not possible to go through all the data manually. We need to mine the data to explore hidden patterns or unknown correlations, find out the dominant topic in data and understand people's interest through the discussions. In this work, we explore Twitter data related to health. We extract the popular topics under different categories (e.g. diet, exercise) discussed in Twitter via topic modeling, observe model behavior on new tweets, discover interesting correlation (i.e. Yoga-Veganism). We evaluate accuracy by comparing with ground truth using manual annotation both for train and test data.

研究动机与目标

  • 揭示社交媒体健康内容中隐藏的相关性,特别是瑜伽与植物性饮食等生活方式实践之间的关联。
  • 应用主题建模技术(LSA、NMF、LDA)从非结构化Twitter数据中提取主导主题。
  • 通过人工标注并对比随机基线,评估模型性能,以验证主题推断的准确性。
  • 识别并分析误导性或无关的主题预测,以提升模型可解释性。
  • 探索使用流数据管道(Kafka、Spark Streaming)实现实时社交媒体健康趋势监控的可行性。

提出的方法

  • 使用Twitter流式API,通过与健身、饮食和健康相关的关键词,收集了40,000条与健康相关的推文。
  • 使用Apache Kafka作为分布式消息队列,实现实时流式处理和高吞吐量的Twitter数据处理。
  • 采用Spark Streaming进行并行与分布式数据处理,以应对大规模推文流的处理需求。
  • 应用三种主题建模算法——潜在语义分析(LSA)、非负矩阵分解(NMF)和潜在狄利克雷分布(LDA),从推文中推断语义主题。
  • 对训练集和测试集中的100至500条推文进行人工标注,以建立准确率评估的基准数据。
  • 使用LIME实现与模型无关的可解释性,以分析和解释被错误分类或误导的主题预测。

实验结果

研究问题

  • RQ1Twitter数据中讨论的主要健康相关主题是什么?它们在不同生活方式类别中如何聚类?
  • RQ2与人工标注的基准数据相比,主题建模算法(LSA、NMF、LDA)在推断健康相关推文真实主题内容方面的准确度如何?
  • RQ3在公共社交媒体话语中,瑜伽与纯素饮食等生活方式行为之间存在哪些隐藏关联?
  • RQ4为何某些主题模型会为特定推文分配误导性或无关的主题?导致此类错误的因素有哪些?
  • RQ5像LIME这样的模型可解释性技术是否有助于识别并解释社交媒体文本分析中的错误主题预测?

主要发现

  • 在对500条人工标注推文的评估中,模型在训练集上达到66%的准确率,在测试集上达到51%的准确率,显著优于四种类别的25%基线水平。
  • 主题1在大多数推文中成为最频繁的主导主题或第二主导主题,其关键词包括“diet”(饮食)、“workout”(锻炼)、“healthy”(健康)和“weightloss”(减重)。
  • 数据中观察到瑜伽与纯素饮食之间存在强烈相关性,许多推文同时提及这两种实践。
  • 由于语言模糊,模型偶尔出现误分类,例如将“water in hand”误解为与游泳相关,导致主题分配误导。
  • 在10个测试案例中有4个存在误导性预测,凸显了使用LIME进行可解释性与错误分析的必要性。
  • Kafka与Spark Streaming的使用实现了大规模Twitter数据流的可扩展、实时处理,支持了大规模主题建模的高效运行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。