Skip to main content
QUICK REVIEW

[论文解读] A large-scale Twitter dataset for drug safety applications mined from publicly existing resources

Ramya Tekumalla, Juan M. Banda|arXiv (Cornell University)|Mar 31, 2020
Social Media in Health Education被引用 15
一句话总结

本文提出一个大规模、公开可用的Twitter数据集,包含1,181,993条与药物使用相关的推文,该数据集从一个94亿条推文的归档中通过基于关键词的过滤方法提取,并利用机器学习模型与人工整理的ADR数据集进行验证。该方法可在无需昂贵爬取或人工标注的情况下,实现可扩展、低成本的药物警戒研究数据收集。

ABSTRACT

With the increase in popularity of deep learning models for natural language processing (NLP) tasks, in the field of Pharmacovigilance, more specifically for the identification of Adverse Drug Reactions (ADRs), there is an inherent need for large-scale social-media datasets aimed at such tasks. With most researchers allocating large amounts of time to crawl Twitter or buying expensive pre-curated datasets, then manually annotating by humans, these approaches do not scale well as more and more data keeps flowing in Twitter. In this work we re-purpose a publicly available archived dataset of more than 9.4 billion Tweets with the objective of creating a very large dataset of drug usage-related tweets. Using existing manually curated datasets from the literature, we then validate our filtered tweets for relevance using machine learning methods, with the end result of a publicly available dataset of 1,181,993 million tweets for public use. We provide all code and detailed procedure on how to extract this dataset and the selected tweet ids for researchers to use.

研究动机与目标

  • 解决获取大规模社交媒体数据用于药物安全研究时的可扩展性与成本问题。
  • 通过重用公开可用的归档数据,减少对昂贵Twitter爬取和人工标注的依赖。
  • 创建一个大规模、经验证的药物使用相关推文数据集,适用于训练和评估药物警戒中的自然语言处理模型。
  • 提供一个可复现的开源流水线,用于从公开的Twitter归档中提取和验证药物相关推文。
  • 支持利用真实世界社交媒体数据开发自动化不良药物反应(ADR)检测系统。

提出的方法

  • 使用一个公开可用的、包含超过94亿条推文的归档数据集作为原始数据源。
  • 应用基于关键词的过滤方法,从完整归档中提取与药物使用相关的推文。
  • 利用在文献中人工整理的ADR数据集训练的机器学习模型,验证筛选出的推文的相关性。
  • 采用多步骤的过滤与验证流水线,确保药物相关推文选择的高精确度。
  • 发布最终数据集,以及完整的代码与操作流程,以支持可复现性与再利用。
  • 使用标准的自然语言处理技术进行过滤与分类,尽管摘要中未详细说明具体模型或架构。

实验结果

研究问题

  • RQ1能否从现有的、公开的归档数据源中有效提取大规模、公开可用的Twitter数据集,用于药物安全应用?
  • RQ2在大规模、无监督的设置下,机器学习模型在验证药物相关推文相关性方面的准确性如何?
  • RQ3基于关键词的过滤结合机器学习验证,能在多大程度上减少药物警戒数据收集中对人工标注的依赖?
  • RQ4一种重用现有Twitter归档数据用于ADR研究的流水线,在可扩展性与可复现性方面表现如何?
  • RQ5此类数据集能否作为训练和评估自然语言处理模型在不良药物反应检测任务中的可靠基准?

主要发现

  • 最终数据集包含从94亿条推文归档中提取的1,181,993条高质量、与药物使用相关的推文。
  • 机器学习验证过程显著提升了筛选数据集的精确度,相较于仅使用关键词过滤的方法。
  • 该数据集公开提供,附带完整代码与文档,使研究社区能够实现可复现与再利用。
  • 该方法消除了对昂贵Twitter API访问或耗时的人工标注进行数据收集的需求。
  • 该方法可有效扩展以处理海量社交媒体数据,适用于药物警戒中大规模自然语言处理应用。
  • 该数据集适用于训练和评估专注于不良药物反应检测及相关任务的自然语言处理模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。