Skip to main content
QUICK REVIEW

[논문 리뷰] Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical Notes

Sunjun Kweon, Junu Kim|arXiv (Cornell University)|2023. 09. 01.
Machine Learning in Healthcare인용 수 5
한 줄 요약

이 논문은 PubMed Central (PMC-Patients)에서 추출한 158,000건의 익명화된 사례 보고서를 기반으로 생성된 158,000건의 합성 임상 노트 전용으로 훈련된 공개 가능한 임상 대규모 언어 모델인 Asclepius를 소개한다. 실질적인 임상 노트로 훈련된 모델들과 비교해도 성능에 큰 차이가 없으며, GPT-3.5-turbo와 동등한 성능을 보이며, 다양한 임상 NLP 작업에서 zero-shot 평가에서도 뛰어난 성능을 보였다. 이는 합성 데이터가 고성능이며 개인정보 보호 기준을 충족하는 임상 LLM을 훈련하는 데 실질적인 대체 수 Mittel이 될 수 있음을 시사한다.

ABSTRACT

The development of large language models tailored for handling patients' clinical notes is often hindered by the limited accessibility and usability of these notes due to strict privacy regulations. To address these challenges, we first create synthetic large-scale clinical notes using publicly available case reports extracted from biomedical literature. We then use these synthetic notes to train our specialized clinical large language model, Asclepius. While Asclepius is trained on synthetic data, we assess its potential performance in real-world applications by evaluating it using real clinical notes. We benchmark Asclepius against several other large language models, including GPT-3.5-turbo and other open-source alternatives. To further validate our approach using synthetic notes, we also compare Asclepius with its variants trained on real clinical notes. Our findings convincingly demonstrate that synthetic clinical notes can serve as viable substitutes for real ones when constructing high-performing clinical language models. This conclusion is supported by detailed evaluations conducted by both GPT-4 and medical professionals. All resources including weights, codes, and data used in the development of Asclepius are made publicly accessible for future research. (https://github.com/starmpcc/Asclepius)

연구 동기 및 목표

  • 임상 대규모 언어 모델 훈련을 위한 실질적인 임상 노트 접근성 부족 문제를 해결하기 위해, 개인정보 보호 규정이 엄격한 환경에서의 데이터 접근 제한 문제를 해결하고자 한다.
  • 병원 환경에서 데이터 프라이버시를 보장하면서 오프라인으로도 구동 가능한 고성능의 현지 배포형 임상 LLM을 개발하고자 한다.
  • 합성 임상 노트가 효과적인 임상 LLM을 훈련시키기 위해 실재 임상 데이터의 실질적인 대체 수 Mittel이 될 수 있는지 평가하고자 한다.
  • 모델 가중치, 코드, 합성 훈련 데이터를 공개하여 개방적이고 재현 가능한 연구를 가능하게 하고자 한다.
  • 실제 임상 노트를 기반으로 한 다양한 NLP 작업에서 모델의 zero-shot 성능을 평가하고자 한다.

제안 방법

  • GPT-3.5-turbo를 사용하여 PubMed Central (PMC-Patients)에서 추출한 158,000건의 익명화된 사례 보고서를 기반으로 합성 임상 노트를 생성하였다.
  • 의료 전문가의 참여를 통해 프롬프트 튜닝을 수행한 GPT-3.5-tur보를 활용하여 지침-답변 쌍을 생성하여 임상 정확성과 관련성을 확보하였다.
  • Transformer 기반 아키텍처를 사용하여 합성 지시-따르기 데이터셋에 대해 Asclepius-7B 및 Asclepius-13B를 피나이팅 하였다.
  • MIMIC-III, MIMIC-IV, i2b2, CASI, MTSamples의 실질적 임상 노트를 사용하여 zero-shot 성능을 평가하였다.
  • 자동화된 벤치마크와 임상의 평가를 병행하여 GPT-3.5-turbo 및 여러 오픈소스 LLM과의 비교 평가를 수행하였다.
  • 모델 가중치, 코드, 합성 데이터 모두를 GitHub에 공개하여 재현 가능성과 향후 연구 지원을 목적으로 하였다.

실험 결과

연구 질문

  • RQ1합성 임상 노트 전용으로 훈련된 임상 대규모 언어 모델이 실재 임상 데이터로 훈련된 모델과 동등한 성능을 달성할 수 있는가?
  • RQ2Asclepius와 같은 합성 데이터 기반 모델이 실제 세계의 임상 NLP 작업에서 zero-shot 환경에서 어떻게 성능을 보이는가?
  • RQ3합성 임상 노트가 고성능 임상 LLM을 훈련시키기 위해 실재 임상 데이터의 실질적인 대체 수 Mittel로 충분히 유용하고 개인정보 보호 기준을 충족할 수 있는가?
  • RQ4실제 임상 노트를 기반으로 평가했을 때, 합성 데이터로 훈련된 모델의 성능이 실재 데이터로 훈련된 모델과 유의미하게 다를까?
  • RQ5현지 배포형 임상 LLM이 GPT-3.5-turbo와 같은 API 기반 모델과 동등한 성능을 달성하면서도 데이터 프라이버시와 보안을 보장할 수 있는가?

주요 결과

  • Asclepius는 MIMIC-III, MIMIC-IV, i2b2, CASI, MTSamples 등의 다양한 임상 NLP 벤치마크에서 GPT-3.5-turbo와 동등한 성능을 보였다. 특히 실재 임상 노트에 대한 zero-shot 작업에서도 유사한 성능을 보였다.
  • GPT-4 및 임상의 평가를 통해 실재 임상 노트로 훈련된 모델과 비교했을 때 합성 데이터 기반 모델의 성능 격차가 유의미하지 않음을 확인하였다.
  • Asclepius는 MIMIC-III, MIMIC-IV, i2b2, CASI, MTSamples의 다양한 임상 노트 유형에서 강력한 zero-shot 일반화 성능을 보였다.
  • 합성 데이터의 사용 덕분에 모델 가중치, 코드, 훈련 데이터를 완전히 공개할 수 있었으며, 이는 임상 AI 분야에서 개방적이고 재현 가능한 연구를 촉진하였다.
  • 임상의 평가 결과, 모델의 출력 결과가 임상적으로 관련성 있고 정확하다는 점이 확인되어 합성 데이터 접근 방식의 타당성을 강화하였다.
  • Asclepius는 합성 데이터 전용으로 훈련된 유일한 임상 LLM로, 단일 모델 내에서 다양한 임상 NLP 작업을 처리할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.