[論文レビュー] Predicting drug recalls from Internet search engine queries
本研究では、米国食品医薬局(FDA)の薬品回収を予測するために、Bing検索エンジンからの集計済みインターネット検索クエリーボリュームを活用することを提案する。特定の医薬品に関するクエリーボリュームの州レベルでの急増を分析することで、1日前の予測においてAUCが0.791に達し、上昇率は5%で約6倍に達する。特に処方薬および中程度リスクの薬品では、より高い性能を示した。
Batches of pharmaceutical are sometimes recalled from the market when a safety issue or a defect is detected in specific production runs of a drug. Such problems are usually detected when patients or healthcare providers report abnormalities to medical authorities. Here we test the hypothesis that defective production lots can be detected earlier by monitoring queries to Internet search engines. We extracted queries from the USA to the Bing search engine which mentioned one of 5,195 pharmaceutical drugs during 2015 and all recall notifications issued by the Food and Drug Administration (FDA) during that year. By using attributes that quantify the change in query volume at the state level, we attempted to predict if a recall of a specific drug will be ordered by FDA in a time horizon ranging from one to 40 days in future. Our results show that future drug recalls can indeed be identified with an AUC of 0.791 and a lift at 5% of approximately 6 when predicting a recall will occur one day ahead. This performance degrades as prediction is made for longer periods ahead. The most indicative attributes for prediction are sudden spikes in query volume about a specific medicine in each state. Recalls of prescription drugs and those estimated to be of medium-risk are more likely to be identified using search query data. These findings suggest that aggregated Internet search engine data can be used to facilitate in early warning of faulty batches of medicines.
研究の動機と目的
- インターネット検索クエリのパターンが、FDAの薬品回収の早期サインとして機能するかどうかを調査すること。
- 特定の薬品に関する検索ボリュームの急増が、その後の回収と相関しているかどうかを同定すること。
- 1〜40日前までの回収予測において、検索クエリデータの予測性能を評価すること。
- 処方薬やリスクレベル(低、中、高)など、どの薬品カテゴリーが検索データを用いて予測されやすいかを特定すること。
- 公共の検索エンジンデータを用いたリアルタイムの早期警戒システムとしての可能性を検討すること。
提案手法
- 2015年における米国各州の5,195種の医薬品について、Bing検索エンジンから日次検索クエリーボリュームを収集した。
- 同じ期間に、FDAの公開データベースから回収のお知らせを抽出した。
- 特に州レベルでの急激な変化に注目し、クエリーボリュームの変化に基づく特徴量を構築した。
- これらのボリューム変化属性を用いて、機械学習分類器を訓練し、1〜40日以内に回収が発生するかどうかを予測した。
- AUCと上位5%の予測における適合率(5%での上昇率)を用いて、モデルの性能を評価した。
- 薬の種類(処方がんvs. OTC)および回収リスクレベル(低、中、高)ごとのサブグループ分析を実施した。
実験結果
リサーチクエスチョン
- RQ1特定の薬品に関するインターネット検索ボリュームの急増は、近い将来のFDAの薬品回収を予測できるか?
- RQ2検索クエリーデータを用いた回収予測の正確性はどの程度か。また、予測期間が長くなると性能はどのように変化するか?
- RQ3処方がんや市販薬など、どの種類の薬品が検索データを用いて予測されやすいか?
- RQ4回収リスクレベル(低、中、高)が、検索クエリーパターンによる検出可能性に影響を与えるか?
- RQ5州レベルでの検索ボリュームの変化は、回収予測のタイムリーさと正確性を向上させることができるか?
主な発見
- 1日前の予測において、受信者操作特性曲線(ROC)下の面積(AUC)は0.791に達した。
- 上位5%の予測において、ランダム選択よりも6倍高い適合率を示す「5%での上昇率」が約6に達した。
- 予測期間が長くなるにつれて性能が低下し、40日前の予測ではAUC値が低くなった。
- 特定の薬品についての州レベルでの検索ボリュームの急増が、回収予測において最も顕著な特徴であった。
- 処方薬および中程度リスクに分類される薬品は、検索クエリーデータを用いて事前に検出されやすかった。
- 結果から、集計済みの検索エンジンデータが、不良な薬品のバッチに対する実用的な早期警戒信号として機能することが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。