Skip to main content
QUICK REVIEW

[論文レビュー] Extracting Adverse Drug Events from Clinical Notes

Darshini Mahendran, Bridget T. McInnes|PubMed|Apr 21, 2021
Topic Modeling参考文献 18被引用数 10
ひとこと要約

本稿では、臨床ノートから副作用薬物イベント(ADE)関係を抽出するためのルールベース、ディープラーニングベース、文脈を考慮した言語モデルベースのアプローチの比較的検討を提案する。n2c2-2018 ADEデータセットを用いて、BioBERTベースの文脈を考慮したモデルが、F1スコア0.94という最先端の性能を達成したが、強さ-薬物や形態-薬物といった特定の関係タイプでは、効果的な共挿入パターンの活用により、ルールベース手法が他の手法を上回った。

ABSTRACT

Adverse drug events (ADEs) are unexpected incidents caused by the administration of a drug or medication. To identify and extract these events, we require information about not just the drug itself but attributes describing the drug (e.g., strength, dosage), the reason why the drug was initially prescribed, and any adverse reaction to the drug. This paper explores the relationship between a drug and its associated attributes using relation extraction techniques. We explore three approaches: a rule-based approach, a deep learning-based approach, and a contextualized language model-based approach. We evaluate our system on the n2c2-2018 ADE extraction dataset. Our experimental results demonstrate that the contextualized language model-based approach outperformed other models overall and obtain the state-of-the-art performance in ADE extraction with a Precision of 0.93, Recall of 0.96, and an F<sub>1</sub> score of 0.94; however, for certain relation types, the rule-based approach obtained a higher Precision and Recall than either learning approach.

研究の動機と目的

  • 構造化されていない臨床ノートからの自動副作用薬物イベント(ADE)抽出の課題に対処すること。これは、患者の安全とコスト削減にとって不可欠である。
  • 薬物-ADE関係を同定するための、多様な関係抽出(RE)技術—ルールベース、ディープラーニング、文脈を考慮した言語モデル—の有効性を調査すること。
  • 用量、強さ、経路、および有害反応などの属性について、関係タイプごとのパフォーマンスを比較すること。
  • ルールベースシステムが単純であるにもかかわらず、学習ベースのモデルを上回る状況を同定すること。
  • 今後の臨床NLPにおけるマルチクラスおよび統合エンティティ-関係モデリングの基盤を提供すること。

提案手法

  • ルールベース手法は、薬物エンティティと属性エンティティ(例:「500mg」が「アスピリン」の近くに存在する)の共挿入パターンを活用して、学習を用いずに関係を推論する。
  • ディープラーニングモデルは、文レベルの表現における薬物-属性ペア間の関係を分類するために、畳み込みニューラルネットワーク(CNNs)を用いる。
  • 文脈を考慮した言語モデルベースの手法では、BioBERTを用いて薬物エンティティペアを含む文全体を符号化し、関係分類に向けた意味的文脈を捉える。
  • 各関係タイプ(例:強さ-薬物、ADE-薬物)は、一般化を向上させるとともにクラスの不均衡を回避するために、個別の二値分類器でモデル化される。
  • モデルは、1,000件のアノテート済み臨床ノートと11,000件の関係インスタンスを含むn2c2-2018 ADE抽出データセットでファインチューニングされる。
  • パフォーマンスは、標準的なNLP指標(精度、再現率、F1スコア)を用いて評価され、関係タイプごとの分析と全体の分析が行われる。

実験結果

リサーチクエスチョン

  • RQ1ルールベース、ディープラーニング、文脈を考慮した言語モデルアプローチは、臨床ノートからのADE関連関係抽出において、どのように比較されるか?
  • RQ2どの関係タイプにおいてルールベース手法が学習ベースのモデルを上回り、その理由は何か?
  • RQ3BioBERTのような文脈を考慮した言語モデルは、n2c2-2018ベンチマークでADE関係抽出において最先端のパフォーマンスを達成できるか?
  • RQ4位置情報と意味的表現は、複数の薬物エンティティペアを含む臨床テキストにおける関係分類にどのように影響するか?
  • RQ5モデルアーキテクチャの選択(例:二値分類対マルチクラス分類)は、リソースが限られた関係タイプにおけるパフォーマンスにどの程度影響を与えるか?

主な発見

  • BioBERTベースの文脈を考慮した言語モデルは、全体のF1スコア0.94を達成し、精度0.93、再現率0.96を示し、n2c2-2018データセットで最先端のパフォーマンスを確立した。
  • ADE-Drug関係タイプにおいて、ルールベースモデルは精度0.88、再現率0.90を達成し、BioBERTモデルのF1スコア(0.97)を上回ったが、精度と再現率の両方では上回らなかった。
  • ルールベース手法は、Form-Drug関係タイプでF1スコア0.95を達成し、BioBERTモデルの0.94を上回り、一貫した共挿入パターンの活用による優れたパフォーマンスを示した。
  • BioBERTモデルは、8つの関係タイプのうち6つで最高のF1スコアを達成し、Strength-Drug(0.94)、Duration-Drug(0.93)、Frequency-Drug(0.94)を含む。
  • UTHチームの共同biLSTM+CRFモデルはF1スコア0.96を達成したが、BioBERTモデルは全チームのうち1つを除き、最高の再現率(0.96)を示し、ADE検出への感受性が優れていた。
  • 本研究では、エンティティを意味的タイプに置き換える(Weiらの手法のように)と、元のエンティティスパンを用いる場合に比べてパフォーマンスが低下することが判明した。これは、エンティティの同一性を保持することが関係モデリングに好影響を及やすことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。