Skip to main content
QUICK REVIEW

[論文レビュー] Pre-training A Neural Language Model Improves The Sample Efficiency of an Emergency Room Classification Model

Binbin Xu, Cédric Gil‐Jardine|arXiv (Cornell University)|Aug 30, 2019
Machine Learning in Healthcare被引用数 8
ひとこと要約

本研究では、ラベルなし救急外来臨床ノートを用いたフランス語GPT-2言語モデルの事前学習が、外傷対象と非外傷対象の分類におけるサンプル効率を顕著に向上させることを示している。わずか160件のラベル付きサンプルで微調整した自己教師あり事前学習を施したモデルは、AUC >0.95を達成し、これは1,600件のラベル付きデータで学習した完全な教師ありモデルと同等の性能である。これにより、必要なラベル付きデータ量を10分の1に削減できた。

ABSTRACT

To build a French national electronic injury surveillance system based on emergency room visits, we aim to develop a coding system to classify their causes from clinical notes in free-text. Supervised learning techniques have shown good results in this area but require a large amount of expert annotated dataset which is time consuming and costly to obtain. We hypothesize that the Natural Language Processing Transformer model incorporating a generative self-supervised pre-training step can significantly reduce the required number of annotated samples for supervised fine-tuning. In this preliminary study, we test our hypothesis in the simplified problem of predicting whether a visit is the consequence of a traumatic event or not from free-text clinical notes. Using fully re-trained GPT-2 models (without OpenAI pre-trained weights), we assess the gain of applying a self-supervised pre-training phase with unlabeled notes prior to the supervised learning task. Results show that the number of data required to achieve a ginve level of performance (AUC>0.95) was reduced by a factor of 10 when applying pre-training. Namely, for 16 times more data, the fully-supervised model achieved an improvement <1% in AUC. To conclude, it is possible to adapt a multi-purpose neural language model such as the GPT-2 to create a powerful tool for classification of free-text notes with only a small number of labeled samples.

研究の動機と目的

  • 自由記述の臨床ノートから救急外来訪問の原因を分類するための教師ありモデルを学習する際の高いアノテーションコストを低減すること。
  • 生成的言語モデルを用いた自己教師あり事前学習が、フランス語医療テキストの低リソースNLP設定におけるサンプル効率を向上させるかどうかを評価すること。
  • フランスの全国的救急医療システムにおける自動外傷監視のためのスケーラブルで低リソースなソリューションを開発すること。
  • 多言語トランスフォーマー・モデル(例:GPT-2)を、OpenAIの事前学習済み重みに依存せずにフランス語臨床言語に適応可能かどうかを評価すること。

提案手法

  • 117Mおよび345Mパラメータを持つ完全に再訓練されたGPT-2モデルを、フランス語救急外来臨床ノートで微調整し、二値の外傷分類タスクに適用した。
  • 二段階の学習プロセスを実施:まず、次トークン予測を用いて2,100万件のラベルなしフランス語臨床ノートで自己教師あり事前学習を実施した。
  • 次に、160~1,600件のラベル付き外傷/非外傷訪問の専門家アノテーション済みデータセットで、事前学習済みモデルを微調整した。
  • 分類タスクを系列から系列への生成問題として扱うために、質問応答形式のプロンプトフォーマットを用いた。
  • AUCを用いて性能を評価し、さまざまなラベル付きデータ量における事前学習済みモデルと非事前学習済みモデルを比較した。
  • 地面真理(グランド・トゥルース)の定義にICD-10コードを用い、外傷対象と非外傷対象のラベル付けに高い一貫性を確保した。

実験結果

リサーチクエスチョン

  • RQ1生成的言語モデルを用いた自己教師あり事前学習により、フランス語救急外来ノートにおける外傷分類のためのラベル付きサンプル数を削減可能か?
  • RQ2大規模なラベルなし臨床テキストで事前学習したモデルは、初期化から学習を開始するモデルと比較して、下流分類タスクの性能にどのように影響を与えるか?
  • RQ3事前学習による性能向上はデータ量に比例するか?最小限のラベル付きデータで高いAUCを達成可能か?
  • RQ4OpenAIの事前学習済み重みに依存せずに、GPT-2のような多言語トランスフォーマー・モデルをフランス語医療テキストに効果的に適応可能か?
  • RQ5医療テキスト分類タスクにおける微調整段階で、事前学習済みモデルと非事前学習済みモデルの学習ダイナミクスにはどのような相違があるか?

主な発見

  • 事前学習により、AUC >0.95を達成するためのラベル付きサンプル数を10分の1に削減(1,600件から160件に)した。
  • 事前学習済みモデルは微調整の過程で単調に増加するAUC曲線を示し、安定的かつ効果的な学習が行われたことを示した。
  • 初期化から学習を開始した完全な教師ありモデルは、AUC >0.95に到達するまでに1,600件のラベル付きデータを必要としたが、16倍のデータを用いた場合でも、事前学習済みモデルよりわずか1%の改善にとどまった。
  • 345MパラメータのGPT-2モデルは、本研究では117Mモデルを上回る性能を示さなかった。これは、計算リソースの制限により完全な学習が行えないことが主な要因とされる。
  • 事前学習フェーズにより、より良い意味的表現の学習が可能となり、ラベル付きデータが極めて少ない状況でも下流分類タスクの性能が向上した。
  • これらの結果は、自己教師あり事前学習が、英語以外の言語における低リソース医療NLPタスクに強力な戦略であることを支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。