Skip to main content
QUICK REVIEW

[論文レビュー] SoftTiger: A Clinical Foundation Model for Healthcare Workflows

Ye Chen, Igor Couto|arXiv (Cornell University)|Mar 1, 2024
Business Process Modeling and AnalysisBusiness, Management and Accounting被引用数 3
ひとこと要約

SoftTiger は、MIMIC-IV から得た匿名化され、資格認定済みの臨床ノートを微調整して、非構造化臨床ナラティブを標準化された FHIR準拠データ(例:国際的患者要約、臨床的印象、医療訪問)に構造化する 13B および 70B パラメータの臨床基盤モデルです。SoftTiger は、臨床ノート処理において最先端のパフォーマンスを達成し、オープンソースモデルや GPT-3.5 を上回り、GPT-4 にわずかに劣る程度の性能を示しており、最大 8k トークンまでの長いコンテキスト窓をサポートしています。

ABSTRACT

We introduce SoftTiger, a clinical large language model (CLaM) designed as a foundation model for healthcare workflows. The narrative and unstructured nature of clinical notes is a major obstacle for healthcare intelligentization. We address a critical problem of structuring clinical notes into clinical data, according to international interoperability standards. We collect and annotate data for three subtasks, namely, international patient summary, clinical impression and medical encounter. We then supervised fine-tuned a state-of-the-art LLM using public and credentialed clinical data. The training is orchestrated in a way that the target model can first support basic clinical tasks such as abbreviation expansion and temporal information extraction, and then learn to perform more complex downstream clinical tasks. Moreover, we address several modeling challenges in the healthcare context, e.g., extra long context window. Our blind pairwise evaluation shows that SoftTiger outperforms other popular open-source models and GPT-3.5, comparable to Gemini-pro, with a mild gap from GPT-4. We believe that LLMs may become a step-stone towards healthcare digitalization and democratization. Therefore, we publicly release SoftTiger models at scales of 13 billion and 70 billion parameters, as well as datasets and code for our innovative scalable evaluation, hopefully, making a significant contribution to the healthcare industry.

研究の動機と目的

  • 大規模言語モデルを用いて、非構造化臨床ノートを標準的で相互運用可能な臨床データに変換するという、極めて重要な課題に取り組む。
  • 基本的タスク(例:省略語の展開)から複雑な臨床ワークフロー タスクまでをカバーできる、軽量で効率的な微調整パイプラインを設計する。
  • コンテキスト長の制限や医学用語の理解の欠如を克服するため、最大 8k トークンの長文臨床データとキュレートされたアノテーションを用いて学習を行う。
  • 13B および 70B パラメータのモデル、データセット、評価コードを公開することで、医療分野のデジタル化と民主化を促進する。
  • 人間によるフィードバックと倫理審査、FHIR 標準準拠を含む、安全性、信頼性、規制適合性を確保する。

提案手法

  • MIMIC-IV から入手した公的かつ資格認定済みの臨床データを用いて、最先端の汎用 LLM を微調整し、臨床ノートを FHIR 準拠のエンティティに構造化することに焦点を当てる。
  • 段階的なトレーニング戦略を設計:まず基本的タスク(例:時系列情報抽出、省略語の展開)を可能にし、その後、複雑な臨床データの構造化に移行する。
  • 推論時に長さの外挿による解像度の損失を避けるために、トレーニング中にコンテキスト窓を 8k トークンまで拡張した。
  • GPT-4 と専門医師によるレビューを用いて 100 件の臨床ノートをアノテートし、トレーニングおよび評価用に高品質で FHIR に整合したデータセットを構築した。
  • LLM をジャッジとして使用し、ChatbotArena 方式のペairwise 比較を用いたスケーラブルでオープンソースの評価フレームワークを実装し、モデルベンチマークを実施した。
  • 実際の臨床デプロイメントに適した、人間による評価と倫理委員会準拠の安全・信頼性プロトコルを統合した。
Figure 1: A survey on complexity and helpfulness of AI clinical tasks.
Figure 1: A survey on complexity and helpfulness of AI clinical tasks.

実験結果

リサーチクエスチョン

  • RQ1臨床基盤モデルは、非構造化臨床ノートを標準的で相互運用可能な FHIR 準拠データに効果的に変換できるか?
  • RQ2長文コンテキストで微調整された LLM は、既存のオープンソースおよび特許取得済みモデルと比較して、複雑な臨床データ構造化タスクでどの程度のパフォーマンスを示すか?
  • RQ3段階的なトレーニングアプローチは、基本的および高度な臨床タスクの両方でモデルのパフォーマンスをどの程度向上できるか?
  • RQ4特に用語マッピングと患者データの機微性保護に関して、臨床ワークフローでの使用において、モデルの出力はどの程度信頼性があり安全か?
  • RQ5キュレートされた専門家によるアノテーションデータは、多様な臨床ノートタイプにわたるモデルの一般化能力とパフォーマンスにどのような影響を与えるか?

主な発見

  • 盲検ペアワイズ評価において、SoftTiger は他のオープンソース LLM や GPT-3.5 を上回り、Gemini-Pro と同等のパフォーマンスを示し、GPT-4 にわずかに劣る程度の性能を達成した。
  • 長文コンテキストの臨床ノートにおいても、推論時に外挿を行わず、8k トークンのコンテキスト窓でトレーニングしたことで、解像度と正確性を維持した強力なパフォーマンスを示した。
  • 段階的なトレーニングアプローチにより、モデルがまず基本的臨床タスク(例:省略語の展開、時系列抽出)を習得した後、複雑なデータ構造化タスクに移行することができた。
  • Hugging Face および PhysioNet で、13B および 70B パラメータのモデル、データセット、評価コードを公開しており、再現性とコミュニティによる拡張が可能である。
  • モデルの出力は FHIR 標準(例:国際的患者要約、臨床的印象、医療訪問)に整合しており、既存の EHR システムとの相互運用性を保証している。
  • 本研究では、専門家によるアノテーションデータと人間によるフィードバックの重要性が強調され、今後の研究ではデータキュレーションの透明性とアノテーター間一貫性指標の向上が期待される。
Figure 2: Training and validation loss for SoftTiger
Figure 2: Training and validation loss for SoftTiger

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。