Skip to main content
QUICK REVIEW

[論文レビュー] Improving Clinical Document Understanding on COVID-19 Research with Spark NLP

Veysel Kocaman, David Talby|arXiv (Cornell University)|Dec 7, 2020
Machine Learning in Healthcare参考文献 23被引用数 4
ひとこと要約

この論文では、Spark NLPに基づくスケーラブルで高精度な臨床NLPパイプラインを提示しており、COVID-19研究における臨床文書理解を向上させている。100種類以上のエンティティタイプを認識し、状態(存在、欠如、条件的、他者関連)を最先端の性能で検出することで、CORD-19データセットからの構造化されたインights抽出を高速かつ正確に実現している。システムは事前学習済みのBi-LSTM-CNN-Charモデルを活用し、分散クラスタ上で効率的にスケーリング可能で、CORD-19データセットからの構造化されたインights抽出を迅速かつ正確に可能にしている。

ABSTRACT

Following the global COVID-19 pandemic, the number of scientific papers studying the virus has grown massively, leading to increased interest in automated literate review. We present a clinical text mining system that improves on previous efforts in three ways. First, it can recognize over 100 different entity types including social determinants of health, anatomy, risk factors, and adverse events in addition to other commonly used clinical and biomedical entities. Second, the text processing pipeline includes assertion status detection, to distinguish between clinical facts that are present, absent, conditional, or about someone other than the patient. Third, the deep learning models used are more accurate than previously available, leveraging an integrated pipeline of state-of-the-art pretrained named entity recognition models, and improving on the previous best performing benchmarks for assertion status detection. We illustrate extracting trends and insights, e.g. most frequent disorders and symptoms, and most common vital signs and EKG findings, from the COVID-19 Open Research Dataset (CORD-19). The system is built using the Spark NLP library which natively supports scaling to use distributed clusters, leveraging GPUs, configurable and reusable NLP pipelines, healthcare specific embeddings, and the ability to train models to support new entity types or human languages with no code changes.

研究の動機と目的

  • 急速に増加する非構造化のCOVID-19科学文献から、実行可能な臨床インサイトを抽出する課題に対処すること。
  • 標準的な生物医学用語に加え、健康の社会的決定要因や有害事象を含む100種類以上の多様なエンティティタイプを認識することで、臨床テキストマイニングを改善すること。
  • 存在、欠如、条件的、および他者関連の臨床的事実を区別できる、堅牢なアサーションステータス検出システムを実装すること。
  • 分散推論と多言語デプロイメントを最小限のコード変更でサポートする、スケーラブルでプロダクション運用可能なNLPパイプラインをSpark NLPを用いて構築すること。
  • CORD-19データセットから、一般的な症状、生命徴、心電図所見などの意味のあるトレンドを抽出するパイプラインの有効性を示すこと。

提案手法

  • 命名エンティティ認識(NER)に、臨床および生物医学データセットで事前学習済みのBi-LSTM-CNN-Charディープラーニングアーキテクチャを採用している。
  • 臨床エンティティの文脈的関連性に基づき、患者に関連する状態を分類するBi-LSTMベースのアサーションステータス検出モジュールを統合している。
  • パイプラインはSpark NLPライブラリを用いて実装されており、クラスタ間での分散処理とGPUアクセラレーションを可能としている。
  • アノテーション済みデータを用いたファインチューニングにより、新しい言語(例:ドイツ語、スペイン語)や新しいエンティティタイプへのゼロコード拡張が可能である。
  • NERとアサーション検出ステップをSpark DataFrames上で連結することで、効率的かつ並列実行が可能な統合的・組み合わせ可能なNLPパイプラインを構築している。
  • パイプラインの性能を測定するため、ローカルおよびクラスタデプロイメントの両方でベンチマークを実施し、速度とスケーラビリティを評価している。

実験結果

リサーチクエスチョン

  • RQ1スケーラブルなNLPパイプラインは、非構造化のCOVID-19文献において100種類以上の異なる臨床および生物医学的エンティティタイプを認識できるか?
  • RQ2アサーションステータス検出は、存在、欠如、条件的、他者関連といった臨床的関連状態をどれほど正確に区別できるか?
  • RQ3単一マシン実行と比較して、分散クラスタにデプロイした場合、Spark NLPパイプラインのパフォーマンスはどの程度スケーリングするか?
  • RQ4構造化・正規化された臨床エンティティとそのアサーションステータスを用いることで、CORD-19データセットからどのようなインサイトを抽出できるか?
  • RQ5再訓練を完全に再開することなく、最小限のコード変更で新しい言語やエンティティタイプにパイプラインを拡張できるか?

主な発見

  • NERモデルはベンチマークデータセットで最先端のパフォーマンスを達成し、健康の社会的決定要因、解剖学的部位、リスク要因、有害事象を含む100種類以上のエンティティタイプを認識している。
  • アサーションステータス検出モデルは、新たなSOTAベンチマークを樹立し、臨床的事実が存在、欠如、条件的、または他者関連であるかを正確に分類している。
  • 10ノードのクラスタで実行した場合、トークン化速度が20倍向上し、NER推論速度が3.5倍向上した(単一マシンと比較)。
  • パイプラインはCORD-19データセットから、頻度の高い症状、疾患、生命徴、心電図所見といった意味のある臨床的トレンドを効果的に抽出した。
  • Spark NLPのモジュラー・アーキテクチャのおかげで、ドイツ語やスペイン語などの新しい言語や新しいエンティティタイプへのゼロコード拡張が可能で、最小限の再構成で実現している。
  • 事前学習済みモデルをスケーラブルかつ分散処理可能なパイプラインに統合することで、大規模な生物医学コーパスにおける効率的でプロダクション運用可能な臨床テキストマイニングが実現可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。