Skip to main content
QUICK REVIEW

[論文レビュー] Deeper Clinical Document Understanding Using Relation Extraction

Hasham Ul Haq, Veysel Kocaman|arXiv (Cornell University)|Dec 25, 2021
Biomedical Text Mining and Ontologies被引用数 7
ひとこと要約

本稿では、二つの新規アーキテクチャ—速度最適化型の全結合ニューラルネットワーク(FCNN)と精度最適化型のBioBERTベースモデル—を用いたスケーラブルな臨床関係抽出(RE)フレームワークを提案する。このフレームワークは、i2b2 2012 時間的関係やn2c2 ポスロジーを含む5つのベンチマークデータセットで最先端のF1スコアを達成し、バイオメディカル知識グラフ構築や、エンティティチャンクの文脈的関係強化による臨床コーディングの向上といった実用的応用を可能にする。

ABSTRACT

The surging amount of biomedical literature & digital clinical records presents a growing need for text mining techniques that can not only identify but also semantically relate entities in unstructured data. In this paper we propose a text mining framework comprising of Named Entity Recognition (NER) and Relation Extraction (RE) models, which expands on previous work in three main ways. First, we introduce two new RE model architectures -- an accuracy-optimized one based on BioBERT and a speed-optimized one utilizing crafted features over a Fully Connected Neural Network (FCNN). Second, we evaluate both models on public benchmark datasets and obtain new state-of-the-art F1 scores on the 2012 i2b2 Clinical Temporal Relations challenge (F1 of 73.6, +1.2% over the previous SOTA), the 2010 i2b2 Clinical Relations challenge (F1 of 69.1, +1.2%), the 2019 Phenotype-Gene Relations dataset (F1 of 87.9, +8.5%), the 2012 Adverse Drug Events Drug-Reaction dataset (F1 of 90.0, +6.3%), and the 2018 n2c2 Posology Relations dataset (F1 of 96.7, +0.6%). Third, we show two practical applications of this framework -- for building a biomedical knowledge graph and for improving the accuracy of mapping entities to clinical codes. The system is built using the Spark NLP library which provides a production-grade, natively scalable, hardware-optimized, trainable & tunable NLP framework.

研究の動機と目的

  • 構造化されていない臨床テキストおよびバイオメディカル文献における意味的関係抽出の増大するニーズに対応すること。
  • 実世界の臨床データ処理に適した、速度と精度のバランスを取ったスケーラブルで生産向けのREモデルを開発すること。
  • エンティティスパンに文脈的関係を強化することで、臨床コーディングの正確性を向上させること。
  • 患者タイムライン生成やバイオメディカル知識グラフ構築といった実用的応用を可能にすること。
  • 関係抽出がSNOMED、CPT、ICD-10コードのエンティティ解決にどのように寄与するかを実証すること。

提案手法

  • REフレームワークは、エンティティスパンを特定する名前付きエンティティ認識(NER)を用い、その後関係分類のためのペairingを行う。
  • FCNNモデルは、意味的類似度、句構造的距離、係り受け解析、および各エンティティ周辺100トークンからの文脈埋め込みを含む、手作業で設計された特徴を用いる。
  • 特徴量は連結され、Leaky ReLU活性化関数とバッチ正則化を経た全結合層を通過し、交差エントロピー損失を用いたソフトマックス層で終了する。
  • BioBERTベースのモデルは、事前学習済みのBioBERTからの転移学習を活用し、臨床テキストにおける関係分類のためのエンドツーエンド微調整を実施する。
  • 両モデルは、大規模な臨床データセットにおけるハードウェア最適化とスケーラブルな推論を実現するため、Apache Spark NLPで実装されている。
  • システムは多クラス関係分類をサポートしており、ハイパーパramータチューニングを複数のデータセットにわたり実施した公開ベンチマークで学習されている。

実験結果

リサーチクエスチョン

  • RQ1軽量なFCNNベースのREモデルは、トランスフォーマー型モデルと比較して、メモリ使用量と推論時間を著しく削減しながらも、競争力のある性能を達成できるか?
  • RQ2係り受け構造や意味的類似度といった文脈特徴を組み込むことで、臨床テキストにおける関係分類の性能はどの程度向上するか?
  • RQ3提案されたREフレームワークは、多様な臨床関係抽出ベンチマークで最先端の性能を達成できるか?
  • RQ4関係を強化したエンティティチャンクは、SNOMED、CPT、ICD-10などの臨床コーディングシステムへのマッピング精度をどのように向上させるか?
  • RQ5このフレームワークは、非構造化臨床ノートから患者タイムラインやバイオメディカル知識グラフを構築するために効果的に利用できるか?

主な発見

  • BioBERTベースのREモデルは、2012年i2b2臨床時間的関係ベンチマークで73.6のF1スコアを達成し、過去の最先端(SOTA)を1.2%上回る新記録を樹立した。
  • FCNNモデルは、2010年i2b2臨床関係データセットでF1スコア69.1を達成し、前回のSOTAを1.2%上回った。
  • 2019年フェノタイプ-遺伝子関係データセットでは、BioBERTモデルがF1スコア87.9を達成し、過去最高結果から8.5%の向上を示した。
  • 2012年有害薬物反応(Drug-Reaction)データセットでは、F1スコア90.0を達成し、前回のSOTAを6.3%上回った。
  • 2018年n2c2ポスロジー関係データセットでは、F1スコア96.7を達成し、前回最良モデルを0.6%上回った。
  • 例として、'CTスキャン胸部(マルチスライス)対照'のような強化されたエンティティチャンクは、'CTスキャン'のような基本チャンクと比較して、CPT/SNOMEDコード(例:71260 vs. 3324F)の正確性が著しく向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。