[論文レビュー] A large-scale Twitter dataset for drug safety applications mined from publicly existing resources
本論文では、94億件のツイートアーカイブからキーワードベースのフィルタリングを用いて抽出した118万1993件の薬物使用関連ツイートからなる大規模かつ公開可能なTwitterデータセットを提示している。このデータセットは、文献に掲載された手作業で整備されたADRデータセットを用いた機械学習による検証を経ており、高コストなクローリングや人的アノテーションを必要とせず、スケーラブルで費用対効果に優れた薬物疫学的モニタリング研究のためのデータ収集を可能にする。
With the increase in popularity of deep learning models for natural language processing (NLP) tasks, in the field of Pharmacovigilance, more specifically for the identification of Adverse Drug Reactions (ADRs), there is an inherent need for large-scale social-media datasets aimed at such tasks. With most researchers allocating large amounts of time to crawl Twitter or buying expensive pre-curated datasets, then manually annotating by humans, these approaches do not scale well as more and more data keeps flowing in Twitter. In this work we re-purpose a publicly available archived dataset of more than 9.4 billion Tweets with the objective of creating a very large dataset of drug usage-related tweets. Using existing manually curated datasets from the literature, we then validate our filtered tweets for relevance using machine learning methods, with the end result of a publicly available dataset of 1,181,993 million tweets for public use. We provide all code and detailed procedure on how to extract this dataset and the selected tweet ids for researchers to use.
研究の動機と目的
- 薬物安全性研究のための大規模なソーシャルメディアデータを収集する際のスケーラビリティとコストの課題を解決すること。
- 高価なTwitterクローリングや人的アノテーションに依存することを減らし、公開済みのアーカイブデータを再利用すること。
- NLPモデルのトレーニングおよび評価に適した、大規模で検証済みの薬物使用関連ツイートデータセットの構築。
- 公開済みのTwitterアーカイブから薬物関連ツイートを抽出・検証する再現可能でオープンソースのパイプラインの提供。
- 実世界のソーシャルメディアデータを活用した、自動化された副作用反応(ADR)検出システムの開発を支援すること。
提案手法
- 94億件を超えるツイートを含む公開済みのアーカイブデータセットを、元データとして使用。
- キーワードベースのフィルタリングを適用し、全アーカイブから薬物使用関連のツイートを抽出。
- 文献に掲載された手作業で整備されたADRデータセットを用いてトレーニングされた機械学習モデルを用いて、フィルタリングされたツイートの関連性を検証。
- 高精度な薬物関連ツイート選択を実現するため、複数段階のフィルタリングおよび検証パイプラインを採用。
- 最終的なデータセットに加え、完全なコードと手順を公開し、再現性および再利用を可能に。
- 標準的なNLP技術をフィルタリングおよび分類に用いたが、要約では具体的なモデルやアーキテクチャの詳細は記載されていない。
実験結果
リサーチクエスチョン
- RQ1大規模かつ公開可能なTwitterデータセットを、事前に存在するアーカイブデータソースから、薬物安全性用途に効果的に抽出できるか?
- RQ2大規模かつ非教師あり設定下で、機械学習モデルが薬物関連ツイートの関連性をどの程度正確に検証できるか?
- RQ3キーワードベースのフィルタリングとML検証を組み合わせることで、薬物疫学的データ収集における人的アノテーションの必要性をどの程度低減できるか?
- RQ4既存のTwitterアーカイブを再利用するADR研究用パイプラインのスケーラビリティと再現可能性はどの程度か?
- RQ5このようなデータセットは、副作用反応検出を目的としたNLPモデルのトレーニングおよび評価のための信頼できるベンチマークとして機能できるか?
主な発見
- 最終的なデータセットは、94億件のツイートアーカイブから抽出された1,181,993件の高品質な薬物使用関連ツイートから構成されている。
- 機械学習による検証プロセスは、キーワードのみによるフィルタリングに比べ、フィルタリング済みデータセットの精度を顕著に向上させた。
- データセットは完全に公開されており、コードとドキュメンテーションを併記しているため、研究コミュニティによる再現性および再利用が可能である。
- データ収集に高価なTwitter APIアクセスや時間的に膨大な人的アノテーションを必要としないため、このアプローチは不要なコストを回避する。
- この方法は、膨大な量のソーシャルメディアデータを効果的に処理できるスケーラビリティを有しており、薬物疫学的分野における大規模NLPアプリケーションに適している。
- このデータセットは、副作用反応検出および関連タスクに特化したNLPモデルのトレーニングおよび評価に適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。