[論文レビュー] Large Language Models to Identify Social Determinants of Health in Electronic Health Records
本研究では、自由記述型電子歴史記録(EHR)から健康の社会的決定要因(SDoH)を抽出するために、ファインチューニングされた大規模言語モデル(LLM)を評価し、合成データ増強が性能を向上させること、特に小規模モデルにおいて顕著であることを示した。また、アルゴリズム的バイアスの低減にも寄与した。最高のモデルは、SDoH同定においてマクロF1スコア0.71を達成し、ゼロショットおよびフェイワショットGPTバージョンを上回り、Icd-10コードと比較して93.8%の有害SDoHを有する患者を特定した。一方、Icd-10コードではたったの2.0%にとどまった。
Social determinants of health (SDoH) have an important impact on patient outcomes but are incompletely collected from the electronic health records (EHR). This study researched the ability of large language models to extract SDoH from free text in EHRs, where they are most commonly documented, and explored the role of synthetic clinical text for improving the extraction of these scarcely documented, yet extremely valuable, clinical data. 800 patient notes were annotated for SDoH categories, and several transformer-based models were evaluated. The study also experimented with synthetic data generation and assessed for algorithmic bias. Our best-performing models were fine-tuned Flan-T5 XL (macro-F1 0.71) for any SDoH, and Flan-T5 XXL (macro-F1 0.70). The benefit of augmenting fine-tuning with synthetic data varied across model architecture and size, with smaller Flan-T5 models (base and large) showing the greatest improvements in performance (delta F1 +0.12 to +0.23). Model performance was similar on the in-hospital system dataset but worse on the MIMIC-III dataset. Our best-performing fine-tuned models outperformed zero- and few-shot performance of ChatGPT-family models for both tasks. These fine-tuned models were less likely than ChatGPT to change their prediction when race/ethnicity and gender descriptors were added to the text, suggesting less algorithmic bias (p<0.05). At the patient-level, our models identified 93.8% of patients with adverse SDoH, while ICD-10 codes captured 2.0%. Our method can effectively extracted SDoH information from clinic notes, performing better compare to GPT zero- and few-shot settings. These models could enhance real-world evidence on SDoH and aid in identifying patients needing social support.
研究の動機と目的
- 電子歴史記録(EHR)における健康の社会的決定要因(SDoH)の記録不足を是正する。これは、患者の予後に顕著な影響を及える。
- 大規模言語モデル(LLM)が非構造化臨床ノートからSDoHを抽出する有効性を評価する。
- 合成臨床テキストが、リソースが限られた環境におけるSDoH抽出性能を向上させるかどうかを調査する。
- 特に人種および性別記述子に関して、LLMにおけるアルゴリズム的バイアスを評価する。
- ファインチューニングされたLLMとゼロショットおよびフェイワショットGPTモデルのSDoH検出精度および耐性の差を比較する。
提案手法
- 10のSDoHカテゴリーを対象に、800件の患者ノートをアノテートし、評価用のゴールドスタンダードデータセットを構築した。
- アノテート済みEHRデータを用いて、Flan-T5 base、large、XL、XXLバージョンを含む複数のトランスフォーマー型LLMをファインチューニングした。
- プロンプト工学およびLLMを用いて合成臨床テキストを生成し、トレーニングデータを拡張し、モデルの一般化性能を向上させた。
- モデルのパフォーマンスを、入院中のEHRおよびMIMIC-IIIデータセットの両方でマクロF1スコアを用いて評価した。
- 入力プロンプトに人種/民族および性別記述子を組み込み、予測の一貫性を測定することで、アルゴリズム的バイアスを評価した。
- 性能差を評価するため、GPTファミリーのモデルを用いたゼロショットおよびフェイワショット推論と、ファインチューニングされたモデルを比較した。
実験結果
リサーチクエスチョン
- RQ1ファインチューニングされた大規模言語モデルは、非構造化EHRノートから健康の社会的決定要因を効果的に抽出できるか?
- RQ2合成データ生成は、特にリソースが限られた環境において、LLMのSDoH同定性能を向上させるか?
- RQ3人種、性別などのデモグラフィック記述子の組み込みが、LLMの予測安定性およびアルゴリズム的バイアスに与える影響は何か?
- RQ4ファインチューニングされたLLMは、ゼロショットおよびフェイワショットGPTモデルと比較して、SDoH検出性能に優れているか?
- RQ5LLMは、従来のIcd-10コードと比較して、有害SDoHを有する患者をどの程度特定できるか?
主な発見
- 最高のパフォーマンスを示したモデル、ファインチューニングされたFlan-T5 XLは、任意のSDoH検出においてマクロF1スコア0.71を達成した。
- 小規模なFlan-T5モデル(baseおよびlarge)は、合成データ増強により最も顕著な性能向上を示し、F1スコアで+0.12~+0.23の向上を記録した。
- チャットGPTと比較して、人種/民族および性別記述子を追加した際、ファインチューニングされたモデルは予測を変更する可能性が著しく低く、アルゴリズム的バイアスが低減していることが示された(p < 0.05)。
- 最高のファインチューニングモデルは、SDoH抽出および予測安定性の両面で、ゼロショットおよびフェイワショットGPTファミリーのモデルを上回った。
- 患者レベルでの評価では、最高のモデルが有害SDoHを有する93.8%の患者を特定したが、Icd-10コードではたった2.0%にとどまった。
- モデルのパフォーマンスは入院中のEHRデータでは一貫していたが、MIMIC-IIIデータセットでは低かった。これはドメインシフトの課題を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。