Skip to main content
QUICK REVIEW

[論文レビュー] Automated Detection of Adverse Drug Reactions in the Biomedical Literature Using Convolutional Neural Networks and Biomedical Word Embeddings

Diego Saldana Miranda|arXiv (Cornell University)|Apr 24, 2018
Pharmacovigilance and Adverse Drug Reactions被引用数 8
ひとこと要約

本論文は、生物医学用語埋め込みを組み込んだ畳み込みニューラルネットワーク(CNN)モデルを提案し、生物医学文献における有害薬物反応(ADR)関連文の自動検出を目的としている。ADEコーパスを用いた研究では、ADR関連文の重複除去と生物医学分野特有の埋め込みが分類性能を顕著に向上させることを示しており、Huynhアーキテクチャがすべての指標で先行モデルを上回り、F1スコア0.798およびAUROC 0.958を達成した。

ABSTRACT

Monitoring the biomedical literature for cases of Adverse Drug Reactions (ADRs) is a critically important and time consuming task in pharmacovigilance. The development of computer assisted approaches to aid this process in different forms has been the subject of many recent works. One particular area that has shown promise is the use of Deep Neural Networks, in particular, Convolutional Neural Networks (CNNs), for the detection of ADR relevant sentences. Using token-level convolutions and general purpose word embeddings, this architecture has shown good performance relative to more traditional models as well as Long Short Term Memory (LSTM) models. In this work, we evaluate and compare two different CNN architectures using the ADE corpus. In addition, we show that by de-duplicating the ADR relevant sentences, we can greatly reduce overoptimism in the classification results. Finally, we evaluate the use of word embeddings specifically developed for biomedical text and show that they lead to a better performance in this task.

研究の動機と目的

  • 生物医学文献におけるADR関連文の自動検出を目的としたディープラーニングモデルの開発と評価。
  • ADR分類における過剰に楽観的な性能推定を軽減するため、文の重複除去が与える影響の調査。
  • 一般用途の単語埋め込み(GloVe)と生物医学特化型単語埋め込み(Pyysaloら)のADR検出における有効性の比較。
  • ADEコーパスを用いて、HuynhのアーキテクチャとHughesのアーキテクチャという2つの異なるCNNアーキテクチャのADR関連性分類性能を評価・ベンチマーク化。
  • 製薬研究における薬物動態監視ワークフローにおけるADR検出システムの信頼性と実用的有用性の向上。

提案手法

  • トークンレベルの畳み込みを用いて、文単位でのADR関連性分類を目的とした、HuynhのアーキテクチャとHughesのアーキテクチャの2種類のCNNアーキテクチャを採用。
  • 評価における過学習および楽観的な性能推定の低減を目的として、ADR関連文の重複除去を実施。
  • 事前学習済み単語埋め込みとして、GloVe 840B(一般用途)およびPyysaloらの埋め込み(生物医学特化型)を用い、分野固有の意味を捉える。
  • 訓練および評価は、20,960件のMEDLINE文(ADR関連:4,272件、非ADR関連:16,688件)からなるADEコーパスを用い、熟練した専門家によるアノテーションが施されたデータセットで実施。
  • 標準的なNLP指標(正確度、適合率、再現率、F1スコア、特異度、AUROC)を用いてモデル性能を評価。
  • 重複除去の有無および異なる埋め込みタイプを比較するアブレーションスタディを実施し、性能に与える要因を特定。

実験結果

リサーチクエスチョン

  • RQ1ADEコーパスにおけるADR関連文の重複除去は、ADR分類におけるより現実的で信頼性の高い性能推定をもたらすか?
  • RQ2生物医学特化型単語埋め込み(例:Pyysaloら)は、GloVeのような一般用途埋め込みと比較してADR検出性能を向上させるか?
  • RQ3評価された2つのCNNアーキテクチャ(HuynhのものとHughesのもの)のうち、どちらがADEコーパスにおいてADR関連文検出で優れた性能を示すか?
  • RQ4分野特化型埋め込みおよび重複除去を用いることで、ADR分類モデルにおける過学習の低減と一般化性能の向上はどの程度達成されるか?
  • RQ5ADEコーパスにおけるアノテーター間合意度の低さが、モデル性能の上限に与える影響は何か?また、これによりモデル設計にどのような示唆が得られるか?

主な発見

  • ADR関連文の重複除去により、性能評価における楽観的傾向が顕著に低減され、より信頼性が高く現実的なモデル評価が可能になった。
  • 生物医学特化型単語埋め込み(Pyysaloら)の使用により、すべての指標でモデル性能が向上し、平均適合率(0.800 vs. 0.780)およびF1スコア(0.798 vs. 0.790)で顕著な向上が観察された。
  • Huynhアーキテクチャは、すべての指標でHughesアーキテクチャを上回り、F1スコア0.798、AUROC 0.958、特異度0.949を達成した。
  • AUROCはGloVeを用いた場合の0.954から、生物医学埋め込みを用いた場合の0.958に上昇し、ADR文と非ADR文の識別性能が向上したことが示された。
  • 高水準のアノテーター間合意度(F1 0.77~0.80)にもかかわらず、人間のアノテーションに内在する曖昧さが、近似完璧なモデル性能の達成を制限している。
  • 重複除去、生物医学特化型埋め込み、およびHuynhのCNNアーキテクチャの組み合わせが、最高の全体的性能を達成した。これは、今後のADR検出システムの強力なベースラインを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。