Skip to main content
QUICK REVIEW

[논문 리뷰] IvyGPT: InteractiVe Chinese pathwaY language model in medical domain

Rongsheng Wang, Yaofei Duan|arXiv (Cornell University)|2023. 07. 20.
Topic Modeling인용 수 4
한 줄 요약

IvyGPT는 고도로 품질이 높은 실제 의사-환자 질의응답 데이터를 사용하여 지도적 미세조정 및 인간 피드백을 통한 강화학습(RLHF)으로 미세조정된 330억 파라미터의 중국어 의료 언어 모델이다. 저자원 효율성을 위해 QLoRA를 사용하여 훈련되었으며, 인간 의사 응답과의 의미적 유사도가 93.58로 최신 기술 수준에 도달하여 기존 모델 대비 응답의 풍부함과 의료 정확도에서 뛰어난 성능을 보였다.

ABSTRACT

General large language models (LLMs) such as ChatGPT have shown remarkable success. However, such LLMs have not been widely adopted for medical purposes, due to poor accuracy and inability to provide medical advice. We propose IvyGPT, an LLM based on LLaMA that is trained and fine-tuned with high-quality medical question-answer (QA) instances and Reinforcement Learning from Human Feedback (RLHF). After supervised fine-tuning, IvyGPT has good multi-turn conversation capabilities, but it cannot perform like a doctor in other aspects, such as comprehensive diagnosis. Through RLHF, IvyGPT can output richer diagnosis and treatment answers that are closer to human. In the training, we used QLoRA to train 33 billion parameters on a small number of NVIDIA A100 (80GB) GPUs. Experimental results show that IvyGPT has outperformed other medical GPT models.

연구 동기 및 목표

  • 일반적인 모델들이 임상 정확도와 문화적 관련성 측면에서 약점을 보이는 점을 보완하기 위해 중국 의료 환경에 특화된 의료 LLM 개발.
  • 실제 의료 상담에서의 응답 품질 향상을 위해 고해상도의 실제 의사-환자 대화 데이터 통합.
  • 제한된 하드웨어에서 330억 파라미터의 대규모 의료 모델을 양자화된 저랭크 적응(QLoRA)을 통해 효과적으로 훈련 가능하게 하기.
  • 인간 피드백을 통한 강화학습(RLHF)을 통해 모델의 응답을 보다 종합적이고 임상적으로 적합한 방향으로 향상시키기.
  • 중국 의료 분야에서 AI가 생성한 응답과 인간 의사의 응답 간 의미적 유사도를 평가하는 기준 마련

제안 방법

  • 모델은 LLaMA 기반으로, 정제된 307,038개의 고품질 중국어 의료 질의응답 쌍 데이터셋을 사용해 지도적 미세조정(SFT)으로 훈련되었다.
  • 응답 품질 평가를 위해 인간 피드백을 기반으로 보상 모델을 훈련하였으며, 평가자들이 모델 출력을 평가한 선호도 데이터를 수집하였다.
  • 응답 생성 최적화를 위해 인간 피드백을 통한 강화학습(RLHF)을 적용하여 깊이와 임상적 관련성을 향상시켰다.
  • 330억 파라미터 모델의 훈련을 위해 4비트 양자화를 사용한 QLoRA를 적용하여 단일 80GB A100 GPU에서 훈련이 가능하도록 하였다.
  • 데이터 품질 확보를 위해 GPT-4를 활용한 데이터 필터링을 포함한 훈련 파이프라인을 구성하였다.
  • 의미적 유사도 평가에는 모델 출력과 인간 의사 응답 간 워드2벡트 임베딩과 코사인 유사도를 사용하였다.

실험 결과

연구 질문

  • RQ1실제 의사-환자 대화 데이터로 미세조정된 대규모 언어 모델이 기존 모델 대비 인간 의사 응답과 더 높은 의미적 유사도를 달성할 수 있는가?
  • RQ2지도적 미세조정에 비해 인간 피드백을 통한 강화학습(RLHF)이 의료 응답의 임상적 깊이와 종합성에 얼마나 기여하는가?
  • RQ34비트 양자화를 사용한 QLoRA를 통해 제한된 하드웨어에서 330억 파라미터의 의료 LLM을 효과적으로 훈련시킬 수 있는가?
  • RQ4훈련 데이터의 품질과 현실성은 모델이 정확하고 맥락 인식 능력이 뛰어난 의료 응답을 생성하는 데 얼마나 기여하는가?
  • RQ5의료 LLM에서 응답 길이와 정보의 풍부함 사이의 상충 관계는 무엇이며, RLHF는 이에 어떻게 영향을 미치는가?

주요 결과

  • IvyGPT는 인간 의사 응답과의 의미적 유사도 점수를 93.58로 기록하여, ChatMed(84.51)와 MedicalGPT(83.73)와 같은 기준 모델들을 크게 앞서며 뛰어난 성능을 보였다.
  • 모델의 평균 응답 단어 수는 271.05로, 다른 중국어 의료 LLM 대비 더 풍부한 정보 커버리지가 가능함을 시사한다.
  • 강화학습은 응답 길이와 깊이를 크게 증가시켜 종합적인 의료 조언 제공 능력 향상이 뚜렷하게 나타났다.
  • QLoRA를 통해 단일 80GB A100 GPU에서 330억 파라미터 모델을 효율적으로 미세조정할 수 있었으며, 전체 미세조정 또는 표준 LoRA 대비 훈련 시간과 메모리 사용량을 줄였다.
  • 다양한 의료 상황에서의 성능이 우수하여, 다단계이고 복잡한 의료 질의에 대해서도 강력한 일반화 능력을 보였다.
  • GPT-4 검증을 거친 307,038개의 실제 의사-환자 질의응답 쌍 데이터셋은 모델의 사실 정확도와 임상적 관련성 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.