Skip to main content
QUICK REVIEW

[論文レビュー] Assessment of contextualised representations in detecting outcome phrases in clinical trials

Micheal Abaho, Danushka Bollegala|arXiv (Cornell University)|Feb 13, 2022
Topic Modeling被引用数 7
ひとこと要約

本稿では、臨床的に標準化された結果語句を備えた300件のRCT要約から構成される、Expertがアノテートした新規データセットEBM-COMETを紹介し、特にファインチューニングされたBioBERTを含む文脈依存表現を用いた完全な結果語句の検出を評価する。最良のモデルは81.5%のF1スコアを達成し、EBM-NLPのSOTAを上回り、厳密な完全語句検出においてファインチューニングされたドメイン特化モデルの優位性を示している。

ABSTRACT

Automating the recognition of outcomes reported in clinical trials using machine learning has a huge potential of speeding up access to evidence necessary in healthcare decision-making. Prior research has however acknowledged inadequate training corpora as a challenge for the Outcome detection (OD) task. Additionally, several contextualized representations like BERT and ELMO have achieved unparalleled success in detecting various diseases, genes, proteins, and chemicals, however, the same cannot be emphatically stated for outcomes, because these models have been relatively under-tested and studied for the OD task. We introduce "EBM-COMET", a dataset in which 300 PubMed abstracts are expertly annotated for clinical outcomes. Unlike prior related datasets that use arbitrary outcome classifications, we use labels from a taxonomy recently published to standardize outcome classifications. To extract outcomes, we fine-tune a variety of pre-trained contextualized representations, additionally, we use frozen contextualized and context-independent representations in our custom neural model augmented with clinically informed Part-Of-Speech embeddings and a cost-sensitive loss function. We adopt strict evaluation for the trained models by rewarding them for correctly identifying full outcome phrases rather than words within the entities i.e. given an outcome "systolic blood pressure", the models are rewarded a classification score only when they predict all 3 words in sequence, otherwise, they are not rewarded. We observe our best model (BioBERT) achieve 81.5\% F1, 81.3\% sensitivity and 98.0\% specificity. We reach a consensus on which contextualized representations are best suited for detecting outcomes from clinical-trial abstracts. Furthermore, our best model outperforms scores published on the original EBM-NLP dataset leader-board scores.

研究の動機と目的

  • 臨床試験の結果検出のための高品質で標準化されたアノテーションコーパスの不足に対処すること。
  • 文脈依存表現(例:BioBERT、SciBERT)が、個々の語ではなく完全な結果語句を検出する性能を評価すること。
  • 完全で連続した語句予測にのみ報酬を与える厳密な評価プロトコルを用いて、完全語句結果検出のベンチマークを確立すること。
  • 特徴抽出および文脈に依存しないアプローチと比較して、ファインチューニングされた文脈依存モデルの臨床的結果検出における性能を評価すること。
  • エビデンスベースド・メディスンおよびシステマティックレビューのワークフローにおける自動結果抽出の正確性と信頼性を向上させること。

提案手法

  • 標準化された分類体系を用いて300件のRCT要約を結果語句でアノテートし、EBM-COMETデータセットを構築する。
  • EBM-COMETデータセット上でドメイン特化された文脈依存言語モデル(BioBERT、SciBERT、ClinicalBERT)をファインチューニングし、結果語句検出を実行する。
  • 臨床的にインスパイアされた品詞埋め込みを組み込んだカスタムニューラルモデルとコスト感受性損失関数を用いて、検出性能を向上させる。
  • 完全で連続した結果語句にのみ報酬を与える厳密な完全語句検出プロトコルを用いてモデルを評価する。部分的または断片的な予測には報酬を与えない。
  • 文脈依存および文脈に依存しないさまざまな文脈依存表現と、ファインチューニング対比特徴抽出の訓練戦略の間で性能を比較する。
  • 結果語句の長さに関するアブレーションスタディおよび誤り分析を実施し、特に長文または曖昧な語句における失敗モードを同定する。

実験結果

リサーチクエスチョン

  • RQ1臨床試験要約における完全な結果語句の検出に最も適した文脈依存表現モデルはどれか?
  • RQ2ファインチューニングされた文脈依存モデルは、特徴抽出アプローチと比較して、結果語句検出性能でどのように異なるか?
  • RQ3標準化された結果語句分類体系を用いることで、結果アノテーションの質と一貫性はどの程度向上するか?
  • RQ4結果語句の長さに応じてモデルの性能と誤りパターンはどのように変化するか。特に多語彙語句においては?
  • RQ5厳密な完全語句評価は、従来のトークンレベル評価と比較して、モデル性能に顕著な差を明らかにするか?

主な発見

  • ファインチューニングされたBioBERTモデルが、EBM-COMETデータセットで最高の性能を示し、F1スコア81.5%、感度81.3%、特異度98.0%を達成した。
  • ファインチューニングされたモデルは、特徴抽出アプローチを常に上回り、収束も速く、結果検出タスクへのエンドツーエンド適応の利点を示している。
  • 最良のモデルは、元のEBM-NLPランクイングで既存のSOTA結果を大きく上回り、PIOタスクにおける結果検出で73.1%のF1スコアを達成した。
  • 6語を超える結果語句では性能が急激に低下し、両モデルとも7語以上の完全な語句スパンを正確に検出できなかった。
  • 厳密な完全語句評価により、モデルが部分的なスパン(例:『収縮期血圧』における『of』の欠落)を誤分類することが明らかになり、高水準のトークンレベル精度にもかかわらずF1が0となった。
  • 誤り分析から、共通語(例:『of』)や重複語句(例:『右心臓のサイズおよび機能』)が誤分類の主な原因であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。