Skip to main content
QUICK REVIEW

[논문 리뷰] Hippocrates: An Open-Source Framework for Advancing Large Language Models in Healthcare

Emre Can Acikgoz, Osman Batur İnce|arXiv (Cornell University)|2024. 04. 25.
Electronic Health Records SystemsHealth Professions인용 수 3
한 줄 요약

Hippocrates는 훈련 및 평가를 위한 오픈소스 프레임워크로, 훈련 데이터, 코드, 체크포인트, 평가 프로토콜에 대한 완전한 액세스를 제공한다. Hippo는 지속적인 사전 훈련, 지시 훈련, 인간 및 AI 피드백을 통한 강화 학습을 통해 최적화된 7B 파라미터 모델의 가족을 도입하여 의료 벤치마크에서 최신 기술 수준의 성능을 달성했으며, MedQA와 USMLE 시험에서 70B 파라미터 모델조차도 뛰어넘었다.

ABSTRACT

The integration of Large Language Models (LLMs) into healthcare promises to transform medical diagnostics, research, and patient care. Yet, the progression of medical LLMs faces obstacles such as complex training requirements, rigorous evaluation demands, and the dominance of proprietary models that restrict academic exploration. Transparent, comprehensive access to LLM resources is essential for advancing the field, fostering reproducibility, and encouraging innovation in healthcare AI. We present Hippocrates, an open-source LLM framework specifically developed for the medical domain. In stark contrast to previous efforts, it offers unrestricted access to its training datasets, codebase, checkpoints, and evaluation protocols. This open approach is designed to stimulate collaborative research, allowing the community to build upon, refine, and rigorously evaluate medical LLMs within a transparent ecosystem. Also, we introduce Hippo, a family of 7B models tailored for the medical domain, fine-tuned from Mistral and LLaMA2 through continual pre-training, instruction tuning, and reinforcement learning from human and AI feedback. Our models outperform existing open medical LLMs models by a large-margin, even surpassing models with 70B parameters. Through Hippocrates, we aspire to unlock the full potential of LLMs not just to advance medical knowledge and patient care but also to democratize the benefits of AI research in healthcare, making them available across the globe.

연구 동기 및 목표

  • 비공개 모델과 닫힌 데이터셋에 의존함으로써 발생하는 의료 LLM 개발의 투명성 부족과 재현성 문제를 해결하기 위해.
  • 의료 LLM 훈련의 복잡성과 접근성 부족으로 인해 학술적 협업과 벤치마크가 저해되는 문제를 해결하기 위해.
  • 모든 구성 요소—데이터, 코드, 체크포인트, 평가 프로토콜—을 오픈소스 모델 하에 공개함으로써 고품질 의료 LLM에 대한 접근을 민주화하기 위해.
  • 다양한 임상 추론 작업을 위한 철저하고 재현 가능한 평가를 지원하는 견고하고 투명한 의료 LLM 훈련 파이프라인을 개발하기 위해.
  • 의료 전문가의 피드백을 강화 학습에서 AI가 생성한 피드백(RLAIF)을 통해 모델 훈련에 통합함으로써 임상적 관련성과 안전성을 향상시키기 위해.

제안 방법

  • 4단계 파이프라인 개발: 정제된 의료 문헌 코퍼스에서의 지속적 사전 훈련, 신규 두 부분으로 구성된 지시 훈련 데이터셋을 활용한 지도적 미세조정, AI가 생성한 피드백을 통한 강화 학습(RLAIF), EleutherAI 벤치마크 세트를 활용한 종합적 평가.
  • 이중 구성 요소 지시 훈련 데이터셋 구축: 데이터 泄漏 방지를 위한 일반 지시 데이터셋과 벤치마크 분할과 정렬된 평가 지시 데이터셋을 통해 직접적인 모델 비교를 가능하게 함.
  • GPT-4와 의료 전문가를 활용해 RLAIF를 위한 선호도 애너테이션을 생성함으로써 모델이 임상 추론 기준과의 일치도를 향상시킴.
  • 기본 모델(Mistral 및 LLaMA2)에서 출발하여 도메인 특화 의료 텍스트에서의 지속적 사전 훈련, 이어 지시 훈련 및 RLHF를 수행함으로써 Hippo 모델을 훈련.
  • EleutherAI 언어 모델 평가 허브를 활용하여 6개의 의료 벤치마크—MedMCQA, PubMedQA, MedQA, USMLE 스텝 1~3—에서 표준화되고 자동화된 평가를 수행.
  • 모든 훈련 설정, 하이퍼파라미터, 모델 체크포인트, 평가 스크립트를 공개함으로써 완전한 재현 가능성을 확보함.

실험 결과

연구 질문

  • RQ1의료 LLM을 위한 완전한 오픈소스 프레임워크가 건강정보 기술 분야에서 더 큰 재현 가능성, 투명성, 커뮤니티 협업을 가능하게 할 수 있는가?
  • RQ2포괄적이고 도메인 적응형 파이프라인을 통해 훈련된 7B 파라미터 모델이 얼마나 큰 70B 파라미터 모델들을 능가할 수 있는가?
  • RQ3RLHF 과정에 의료 전문가의 피드백을 통합할 경우 모델 성능과 임상 추론 품질에 어떤 영향을 미치는가?
  • RQ4데이터 정제와 파이프라인 설계(예: 이중 지시 훈련 데이터셋)가 모델 일반화 능력과 벤치마크 성능에 어떤 영향을 미치는가?
  • RQ5표준화된 오픈 평가 프레임워크가 의료 LLM 간의 변동성을 줄이고 비교 가능성을 향상시키는 데 어떤 영향을 미치는가?

주요 결과

  • Hippo-7B는 MedQA 벤치마크에서 59.9%의 5-shot 정확도를 기록하여 기존의 모든 오픈소스 모델, 더 큰 70B 파라미터 모델들까지도 능가했다.
  • USMLE-step-1 및 USMLE-step-2 벤치마크에서 Hippo-7B는 경쟁력 있는 성능을 보였으며, 복잡한 임상 추론 과제에서 85%의 경우 골드 표준 답변과 일치하는 모델 응답을 제공했다.
  • Hippo-7B 모델은 뛰어난 추론 능력과 지식 검색 능력을 보였으며, 응답의 92%가 올바른 이해, 추론, 과학적 공감대 일치를 보였다.
  • 일반 지시 데이터셋과 평가 지시 데이터셋을 포함한 이중 지시 훈련 데이터셋의 사용은 데이터 泄漏를 크게 줄이고 공정하고 신뢰할 수 있는 벤치마크 비교를 가능하게 했다.
  • 의료 전문가의 선호도를 반영한 AI가 생성한 피드백을 통한 강화 학습(RLAIF)은 모델이 임상 기준과의 일치도를 향상시켜 유해하거나 잘못된 응답을 감소시켰다.
  • 훈련 데이터, 코드, 체크포인트, 평가 프로토콜의 완전한 공개는 완전한 재현 가능성을 보장하며 커뮤니티 기반의 모델 개선과 감사 활동을 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.