Skip to main content
QUICK REVIEW

[論文レビュー] Hippocrates: An Open-Source Framework for Advancing Large Language Models in Healthcare

Emre Can Acikgoz, Osman Batur İnce|arXiv (Cornell University)|Apr 25, 2024
Electronic Health Records SystemsHealth Professions被引用数 3
ひとこと要約

Hippocrates は、トレーニングデータ、コード、チェックポイント、評価プロトコルをすべて公開するオープンソースフレームワークであり、医療用大規模言語モデルのトレーニングと評価を可能にする。Hippo は、継続的事前学習、インstructチューニング、人間およびAIフィードバックからの強化学習を経て微調整された 7B パラメータのモデル群であり、医療ベンチマークで最先端のパフォーマンスを達成しており、MedQA や USMLE 試験においても 70B パラメータのモデルを上回っている。

ABSTRACT

The integration of Large Language Models (LLMs) into healthcare promises to transform medical diagnostics, research, and patient care. Yet, the progression of medical LLMs faces obstacles such as complex training requirements, rigorous evaluation demands, and the dominance of proprietary models that restrict academic exploration. Transparent, comprehensive access to LLM resources is essential for advancing the field, fostering reproducibility, and encouraging innovation in healthcare AI. We present Hippocrates, an open-source LLM framework specifically developed for the medical domain. In stark contrast to previous efforts, it offers unrestricted access to its training datasets, codebase, checkpoints, and evaluation protocols. This open approach is designed to stimulate collaborative research, allowing the community to build upon, refine, and rigorously evaluate medical LLMs within a transparent ecosystem. Also, we introduce Hippo, a family of 7B models tailored for the medical domain, fine-tuned from Mistral and LLaMA2 through continual pre-training, instruction tuning, and reinforcement learning from human and AI feedback. Our models outperform existing open medical LLMs models by a large-margin, even surpassing models with 70B parameters. Through Hippocrates, we aspire to unlock the full potential of LLMs not just to advance medical knowledge and patient care but also to democratize the benefits of AI research in healthcare, making them available across the globe.

研究の動機と目的

  • 特許権のあるモデルや閉鎖型データセットに依存する医療 LLM 開発における透明性と再現可能性の欠如に対処する。
  • 医療 LLM のトレーニングの複雑さとアクセスの難しさを克服し、学術的協力やベンチマーク評価を妨げる要因を解消する。
  • すべてのコンponents—データ、コード、チェックポイント、評価プロトコル—をオープンソースで公開することで、高品質な医療 LLM へのアクセスを民主化する。
  • 多様な臨床的推論タスクにおける厳密で再現可能な評価を可能にする、強固で透明な医療 LLM トレーニングパイプラインを構築する。
  • AI が生成するフィードバックからの強化学習(RLAIF)を活用し、医療専門家のフィードバックをモデルトレーニングに統合することで、臨床的関連性と安全性を向上させる。

提案手法

  • 4段階のパイプラインを開発:キュレートされた医療コーパスにおける継続的事前学習、新規の2部構成のインstructデータセットを用いた教師あり微調整、AI が生成するフィードバックからの強化学習(RLAIF)、EleutherAI ベンチマークスイートを用いた包括的評価。
  • 2段階のインストラクションチューニングデータセットを構築:データ漏洩を防ぐための一般インストラクションデータセット(General Instruction Dataset)と、ベンチマーク分割と整合性を持つ評価インストラクションデータセット(Evaluation Instruction Dataset)を別々に用意し、直接的なモデル比較を可能にする。
  • GPT-4 および医療専門家を活用して、RLAIF のための好みのアノテーションを生成し、モデルの臨床的推論基準との整合性を高める。
  • ベースモデル(Mistral および LLaMA2)から出発し、ドメイン特化された医療テキストにおける継続的事前学習、その後にインストラクションチューニングおよび RLHF を実施することで、Hippo モデルをトレーニングする。
  • EleutherAI の言語モデル評価ハブを活用して、6つの医療ベンチマーク(MedMCQA、PubMedQA、MedQA、および USMLE ステップ 1~3)における評価を標準化・自動化する。
  • すべてのトレーニング設定、ハイパーパramータ、モデルチェックポイント、評価スクリプトを公開することで、完全な再現性を確保する。

実験結果

リサーチクエスチョン

  • RQ1完全にオープンソースの医療 LLM フレームワークは、医療 AI 分野における再現性、透明性、コミュニティ協働の向上を実現できるか?
  • RQ2包括的かつドメイン適合されたパイプラインでトレーニングされた 7B パラメータのモデルが、70B パラメータのモデルを上回る可能性はどの程度か?
  • RQ3RLHF プロセスに医療専門家のフィードバックを組み込むことで、モデルのパフォーマンスおよび臨床的推論の質にどのような影響を与えるか?
  • RQ4データキュレーションおよびパイプライン設計(例:二重インストラクションデータセット)は、モデルの汎化性能およびベンチマークパフォーマンスにどのような影響を与えるか?
  • RQ5標準化されたオープン評価フレームワークは、医療 LLM 間のばらつきを低減し、比較可能性を向上させることができるか?

主な発見

  • Hippo-7B は MedQA ベンチマークで 59.9% の 5 ショット精度を達成し、70B パラメータのモデルを含む、すべての既存のオープンソースモデルを上回っている。
  • USMLE-step-1 および USMLE-step-2 ベンチマークでは、Hippo-7B は競争力のあるパフォーマンスを示しており、複雑な臨床的推論タスクにおいて 85% のケースでゴールスタンダードの回答と一致している。
  • Hippo-7B モデルは、優れた推論力と知識取得能力を示しており、92% の回答で正しい理解、推論、科学的コンSENSUSとの整合性を示している。
  • 一般用と評価用の2種類のインストラクションチューニングデータセットを用いることで、データ漏洩が顕著に低減され、より公平で信頼性の高いベンチマーク比較が可能になった。
  • 医療専門家の好みを反映した AI が生成するフィードバックからの強化学習(RLAIF)により、モデルの臨床基準との整合性が向上し、有害または誤った出力を低減した。
  • トレーニングデータ、コード、チェックポイント、評価プロトコルを完全に公開することで、完全な再現性が実現され、コミュニティ主導のモデル改善および監査が促進された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。