Skip to main content
QUICK REVIEW

[논문 리뷰] Qibo: A Large Language Model for Traditional Chinese Medicine

Heyi Zhang, Xin Wang|arXiv (Cornell University)|2024. 03. 24.
Traditional Chinese Medicine Studies인용 수 13
한 줄 요약

Qibo는 사전 학습에서 감독 학습 미세조정까지를 거친 중국어-라마 기반의 LLM으로, 맞춤형 전통 중국의학 말뭉치와 전용 평가 벤치마크를 통해 TCM 이해 및 응용을 평가한다.

ABSTRACT

Large Language Models (LLMs) has made significant progress in a number of professional fields, including medicine, law, and finance. However, in traditional Chinese medicine (TCM), there are challenges such as the essential differences between theory and modern medicine, the lack of specialized corpus resources, and the fact that relying only on supervised fine-tuning may lead to overconfident predictions. To address these challenges, we propose a two-stage training approach that combines continuous pre-training and supervised fine-tuning. A notable contribution of our study is the processing of a 2GB corpus dedicated to TCM, constructing pre-training and instruction fine-tuning datasets for TCM, respectively. In addition, we have developed Qibo-Benchmark, a tool that evaluates the performance of LLM in the TCM on multiple dimensions, including subjective, objective, and three TCM NLP tasks. The medical LLM trained with our pipeline, named $ extbf{Qibo}$, exhibits significant performance boosts. Compared to the baselines, the average subjective win rate is 63%, the average objective accuracy improved by 23% to 58%, and the Rouge-L scores for the three TCM NLP tasks are 0.72, 0.61, and 0.55. Finally, we propose a pipline to apply Qibo to TCM consultation and demonstrate the model performance through the case study.

연구 동기 및 목표

  • 전통 중국의학(TCM)에 대한 도메인 특화 LLM의 필요성 제시를 통해 TCM 이론과 현대 AI 모델 간의 격차를 해소한다.
  • TCM 중심 LLM을 위한 전체 학습 파이프라인(사전 학습에서 SFT까지)을 개발한다.
  • 높은 품질의 다양하고 정제된 TCM 말뭉치와 도메인 지식 습득을 위한 데이터 처리 규칙을 구성한다.
  • Qibo-benchmark를 만들어 LLM의 TCM 지식, 추론 및 안전성 평가를 정량적으로 수행한다.

제안 방법

  • 다양한 TCM 및 현대 의학 말뭉치를 대상으로 지속적 사전 학습을 수행하여 중국어-LLaMA에 도메인 지식과 진단 추론 능력을 주입한다.
  • Alpaca와 유사한 대화 형식으로 번역된 다원 소스 TCM 대화 데이터셋을 사용한 감독 미세조정(SFT).
  • SFT를 위한 네 가지 데이터 소스의 도입: TCM 단일 턴 및 다중 턴 대화, TCM NLP 작업 데이터, 일반 의학 대화로 도메인 관련성 및 일반화를 보장한다.
  • 고품질의 학습 코퍼스를 만들기 위한 문자-레벨 및 문단-레벨의 다중 해상도 정리 및 수작업 검증이 포함된 데이터 처리 파이프라인.
  • GPT-4와 인간 전문가 평가, 그리고 객관적 NLP 작업 벤치마크를 통한 안전성, 품위 및 유창성 평가.

실험 결과

연구 질문

  • RQ1사전 학습에서 SFT까지를 통해 LLaMA 기반 모델을 전통 중국의학에 특화되도록 얼마나 효과적으로 학습시킬 수 있는가?
  • RQ2도메인 특화 말뭉치와 평가 벤치마크가 일반 의학 LLM과 비교했을 때 모듈의 TCM 이해, 변증 및 처방 인식 능력을 향상시키는가?
  • RQ3Qibo가 안전성과 전문성을 유지하면서 TCM 특정 작업 및 다중 턴 대화에서 기존 중국 의학 LLM보다 성능을 발휘할 수 있는가?
  • RQ4TCM 중심의 LLM을 실무에 배치할 때의 한계점과 안전성 고려사항은 무엇인가?

주요 결과

  • Qibo는 주관적(전문성, 안전성, 유창성) 및 객관적 평가에서 전통 중국의학 분야에서 강력한 도메인 성능을 입증한다.
  • Qibo-13B는 다중 턴 TCM 평가 작업에서 Qibo-7B보다 정확도가 높아 프레임워크 내에서 규모의 이점을 나타낸다.
  • TCM NLP 작업에서 Qibo는 종종 기준 의료 모델을 능가하지만 해당 작업에 최적화된 과제별 모델보다 뒤처질 수 있다.
  • 저자들은 모델 간의 TCM 이해 및 응용의 정량적 비교가 가능한 전용 Qibo-벤치마크를 제공한다.
  • 모델은 한계와 잠재적 부정확성을 포함한 현실 의료 적용 시 주의가 필요함을 인정하고, 향후 안전성 및 다중 모달 통합 연구를 지목한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.