[論文レビュー] Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical Notes
本論文では、公開利用可能な症例報告書から生成された158,000件の合成臨床ノートに限定して訓練された、公開可能な臨床用大規模言語モデルAsclepiusを紹介する。実際の臨床ノートで訓練されたモデルと同等の性能を示す一方で、合成データで訓練されているにもかかわらず、多様な臨床NLPタスクにおけるゼロショット評価でGPT-3.5-turboおよび実データで訓練されたモデルと同等の性能を発揮し、合成データがプライバシーに配慮した高パフォーマンスな臨床用LLMを訓練するための有効な代替手段であることを示している。
The development of large language models tailored for handling patients' clinical notes is often hindered by the limited accessibility and usability of these notes due to strict privacy regulations. To address these challenges, we first create synthetic large-scale clinical notes using publicly available case reports extracted from biomedical literature. We then use these synthetic notes to train our specialized clinical large language model, Asclepius. While Asclepius is trained on synthetic data, we assess its potential performance in real-world applications by evaluating it using real clinical notes. We benchmark Asclepius against several other large language models, including GPT-3.5-turbo and other open-source alternatives. To further validate our approach using synthetic notes, we also compare Asclepius with its variants trained on real clinical notes. Our findings convincingly demonstrate that synthetic clinical notes can serve as viable substitutes for real ones when constructing high-performing clinical language models. This conclusion is supported by detailed evaluations conducted by both GPT-4 and medical professionals. All resources including weights, codes, and data used in the development of Asclepius are made publicly accessible for future research. (https://github.com/starmpcc/Asclepius)
研究の動機と目的
- 臨床大規模言語モデルを訓練するにあたり、厳格なプライバシー規制により実臨床ノートへのアクセスが制限されるという課題に対処すること。
- 病院環境におけるデータプライバシーを確保しながら、オフラインで動作するローカルにデプロイ可能な高パフォーマンスな臨床用LLMを開発すること。
- 合成臨床ノートが、効果的な臨床用LLMを訓練するための実臨床データの代替として十分に機能するかどうかを評価すること。
- モデル重み、コード、および合成トレーニングデータを公開することで、オープンかつ再現可能な研究を促進すること。
- 多様なNLPタスクにおける実臨床ノートに対するモデルのゼロショット性能を評価すること。
提案手法
- 158,000件の匿名化された症例報告書(PubMed Central(PMC-Patients)より抽出)を用いて、GPT-3.5-turboを用いて合成臨床ノートを生成した。
- 医療専門家がプロンプトチューニングに参加することで、GPT-3.5-turboを用いて医療的正確性と関連性を確保した、指示-回答ペアを作成した。
- 変換器ベースのアーキテクチャを用いて、合成された指示従いデータセット上でAsclepius-7BおよびAsclepius-13Bをファインチューニングした。
- MIMIC-III、MIMIC-IV、i2b2、CASI、MTSamplesからの実臨床ノートを用いて、ゼロショット性能を評価した。
- 自動ベンチマークと臨床医による評価を併用して、GPT-3.5-turboおよび複数のオープンソースLLMと比較評価した。
- モデル重み、コード、および合成データをすべてGitHubに公開し、再現可能性および今後の研究を支援した。
実験結果
リサーチクエスチョン
- RQ1完全に合成臨床ノートでのみ訓練された臨床用大規模言語モデルが、実臨床データで訓練されたモデルと同等の性能を達成できるか?
- RQ2GPT-3.5-turboのようなAPIベースのモデルと同等の性能を発揮する、合成データで訓練されたモデルが、実世界の臨床NLPタスクにおいてゼロショット設定でどの程度の性能を示すか?
- RQ3合成臨床ノートが、高パフォーマンスな臨床用LLMを訓練するうえで、実臨床データの実用的でプライバシーに配慮した代替手段としてどの程度有効に機能するか?
- RQ4実臨床ノートに対する評価において、実データで訓練されたモデルと比較して、合成データで訓練されたモデルの性能に顕著な差が生じるか?
- RQ5ローカルにデプロイ可能な臨床用LLMが、GPT-3.5-turboのようなAPIベースのモデルと同等の性能を発揮しながら、データプライバシーとセキュリティを確保できるか?
主な発見
- Asclepiusは、MIMIC-III、MIMIC-IV、i2b2、CASI、MTSamplesなど、多様な臨床NLPベンチマークでGPT-3.5-turboと同等の性能を発揮し、実臨床ノートに対するゼロショットタスクでも同様の結果を示した。
- GPT-4および臨床医による評価を通じて、実臨床ノートで訓練されたモデルと比較して、合成データで訓練されたモデルに顕著な性能差が認められなかった。
- Asclepiusは、MIMIC-III、MIMIC-IV、i2b2、CASI、MTSamplesからの多様な臨床ノートタイプにおいて、強力なゼロショット一般化性能を示した。
- 合成データの使用により、モデル重み、コード、トレーニングデータを完全に公開することが可能となり、臨床AI分野におけるオープンかつ再現可能な研究を促進した。
- 臨床医による評価を通じて、モデル出力の臨床的関連性と正確性が確認され、合成データアプローチの有効性が裏付けられた。
- Asclepiusは、完全に合成データで訓練され、1つのローカルデプロイ可能なモデルとして複数の臨床NLPタスクを処理できる初の臨床用LLMである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。