Skip to main content
QUICK REVIEW

[論文レビュー] Learning structures of the French clinical language:development and validation of word embedding models using 21 million clinical reports from electronic health records

Basile Dura, Charline Jean|arXiv (Cornell University)|Jul 26, 2022
Machine Learning in Healthcare被引用数 6
ひとこと要約

本研究では、APHPの電子歴史記録から得た2100万件のフランス語臨床レポートを微調整した、CamemBERTベースの単語埋め込みモデルを2つ開発・検証した。臨床NLPタスク(APMed)においてF1スコアが3パーセンテージポイント向上(91%まで)した。これは、ドメイン特化型の事前学習が性能を顕著に向上させることを示しており、学習を初期化から行うか微調整するかの差に顕著な差は認められない。

ABSTRACT

Background Clinical studies using real-world data may benefit from exploiting clinical reports, a particularly rich albeit unstructured medium. To that end, natural language processing can extract relevant information. Methods based on transfer learning using pre-trained language models have achieved state-of-the-art results in most NLP applications; however, publicly available models lack exposure to speciality-languages, especially in the medical field. Objective We aimed to evaluate the impact of adapting a language model to French clinical reports on downstream medical NLP tasks. Methods We leveraged a corpus of 21M clinical reports collected from August 2017 to July 2021 at the Greater Paris University Hospitals (APHP) to produce two CamemBERT architectures on speciality language: one retrained from scratch and the other using CamemBERT as its initialisation. We used two French annotated medical datasets to compare our language models to the original CamemBERT network, evaluating the statistical significance of improvement with the Wilcoxon test. Results Our models pretrained on clinical reports increased the average F1-score on APMed (an APHP-specific task) by 3 percentage points to 91%, a statistically significant improvement. They also achieved performance comparable to the original CamemBERT on QUAERO. These results hold true for the fine-tuned and from-scratch versions alike, starting from very few pre-training samples. Conclusions We confirm previous literature showing that adapting generalist pre-train language models such as CamenBERT on speciality corpora improves their performance for downstream clinical NLP tasks. Our results suggest that retraining from scratch does not induce a statistically significant performance gain compared to fine-tuning.

研究の動機と目的

  • フランス語臨床レポートにおける事前学習の、下流の医療NLPタスクへの影響を評価すること。
  • 既存のCamemBERTモデルを臨床データで微調整するのと、臨床データで再学習するのを比較すること。
  • 意味のある臨床言語表現を学習するために必要な最小限のデータ量と学習ステップ数を評価すること。
  • 2つのフランス語医療NLPベンチマーク、APMedおよびQUAEROでモデルを検証すること。
  • 専門分野言語の事前学習が、一般用途モデルに比べてフランス語臨床NLPで性能を向上させるかどうかを確認すること。

提案手法

  • 2100万件のフランス語臨床レポートを用いて、1つは初期化から学習し、もう1つは元のCamemBERTから微調整したCamemBERTベースのモデルを事前学習した。
  • 39の病院と1100万人の患者をカバーするAPHP臨床データウェアハウス(EDS)の洗練されたコーパスを用いた。
  • 文書のメタタイプ(例:診察記録、画像診断、手術記録)のバランスをとるため、階層的サンプリングを適用し、管理的ノイズを低減した。
  • 非臨床的テキスト汚染(例:患者の権利に関する記述)を検出・削除するために、オープンソースのspaCyベースのパイプラインEDS-NLPを採用した。
  • 2つのアノテート済みデータセットでモデルを微調整した:APMed(薬剤の記載と投与量認識)およびQUAERO(UMLSの意味的グループに跨る医療用語認識)。
  • F1スコアを用いて性能を評価し、改善の有意性を検証するためにウィルコクソン符号順位検定を適用した。

実験結果

リサーチクエスチョン

  • RQ1一般用途モデルと比較して、フランス語臨床レポートで事前学習することで、下流の医療NLPタスクの性能が向上するか?
  • RQ2臨床データで既存のCamemBERTモデルを微調整するのと、初期化から再学習するのとで、統計的に有意な性能向上が得られるか?
  • RQ3初期化から学習するにあたり、有効な臨床言語表現を学習するために必要な学習ステップ数とデータ量はどれほどか?
  • RQ4臨床データで事前学習したモデルは、多様なコーパスに跨るエンティティ認識などの他の医療NLPタスクにも一般化できるか?
  • RQ5限定的な事前学習データから開始する場合、初期化方法(初期化から学習 vs. 微調整)が下流の性能に影響を及ぼすか?

主な発見

  • 臨床レポートで事前学習したモデルは、APMedタスクでF1スコアが3パーセンテージポイント向上し、91%に達した。ウィルコクソン検定により統計的有意性が確認された。
  • APMedにおける性能向上は、初期化から学習したバージョンと微調整したバージョンの両方で一貫しており、初期化方法ではなく、ドメイン特化型の事前学習が主因であることが示された。
  • QUAEROベンチマークでは、元のCamemBERTと同等の性能を達成しており、他の医療NLPタスクへの一般化能力が強いことが示された。
  • 初期化から学習したモデルと微調整したモデルの間で、統計的に有意な性能差は認められず、微調整が十分であり、より効率的であることが示唆された。
  • 結果から、専門分野の臨床コーパスで事前学習することで、医療NLPのモデル性能が顕著に向上することが確認された。また、限られたデータでも有効であり、完全な再学習に代わる代替手段として微調整が実用的かつ効率的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。