[논문 리뷰] BianCang: A Traditional Chinese Medicine Large Language Model
BianCang은 Qwen에서 구축된 두 단계 학습 TCM-특화 LLM로, 연속 사전 학습을 통해 광범위한 한의학 지식을 주입하고 감독된 파인튜닝으로 실제 작업과 정렬하여 11개의 테스트 세트에서 강력한 증후군 구분 및 진단 성능을 달성합니다.
The surge of large language models (LLMs) has driven significant progress in medical applications, including traditional Chinese medicine (TCM). However, current medical LLMs struggle with TCM diagnosis and syndrome differentiation due to substantial differences between TCM and modern medical theory, and the scarcity of specialized, high-quality corpora. To this end, in this paper we propose BianCang, a TCM-specific LLM, using a two-stage training process that first injects domain-specific knowledge and then aligns it through targeted stimulation to enhance diagnostic and differentiation capabilities. Specifically, we constructed pre-training corpora, instruction-aligned datasets based on real hospital records, and the ChP-TCM dataset derived from the Pharmacopoeia of the People's Republic of China. We compiled extensive TCM and medical corpora for continual pre-training and supervised fine-tuning, building a comprehensive dataset to refine the model's understanding of TCM. Evaluations across 11 test sets involving 31 models and 4 tasks demonstrate the effectiveness of BianCang, offering valuable insights for future research. Code, datasets, and models are available on https://github.com/QLU-NLP/BianCang.
연구 동기 및 목표
- 정확한 증후군 구분 및 질병 진단을 수행할 수 있는 TCM 중심 LLM의 개발 동기를 제시한다.
- 지속적 사전 학습을 통해 광범위한 한의학 및 의학 지식을 주입하여 견고한 지식 기반을 확립한다.
- 다양한 TCM 지시와 실제 데이터를 대상으로 한 표적 감독 파인튜닝을 통해 내재 지식을 정렬하고 활성화한다.
- 증후군 구분, 진단, 시험 등 여러 평가 지표에서 다수의 기준선과 비교하여 강인성을 입증한다.
제안 방법
- Qwen 기반 기초 위에서의 두 단계 학습: 대규모 TCM/의료 코퍼스 및 실제 기록으로의 지속적 사전 학습과 도메인 특화 지시를 통한 감독 파인튜닝.
- 의학서, 백과사전, 문헌, 약전, 의무 기록, TCMSD&DD 기록 및 전문 지식 기반 등을 포함한 포괄적 사전 학습 데이터셋의 구성.
- ChP-TCM 기반 지시 데이터셋(ChP-KnowledgeQA, ChP-PrescriptionWriting) 개발 및 의무 기록 및 다회 대화 SFT 데이터셋(DISC-Med-SFT, MLEC-SFT, TCM-SFT 변형) 구축.
- A100 GPU에서 두 에폭에 걸쳐 SWIFT를 사용한 전체 매개변수 파인튜닝으로 7B 및 14B 규모의 파인튜닝 수행, 정규화 및 학습 안정성 휴리스틱 적용.
- 11개 테스트 세트와 4개 작업에 걸친 평가, GPT-4를 포함한 의학 및 TCM LLM을 포함한 광범위한 기준선과의 비교를 통해 TCM 증후군 구분, 진단, 시험에서의 개선 여부를 확인.
실험 결과
연구 질문
- RQ1두 단계 학습 패러다임을 사용하여 TCM 중심 LLM이 우수한 증후군 구분 및 진단을 달성할 수 있는가?
- RQ2광범위한 TCM/의료 코퍼스와 실제 환자 데이터를 담은 지속적 사전 학습이 TCM 작업의 다운스트림 SFT 성능에 어떤 영향을 미치는가?
- RQ3ChP-TCM 지시 세트를 통한 표적 정렬이 TCM의 실제 진단 및 치료 계획 능력을 향상시키는가?
- RQ4다양한 객관적 및 주관적 평가 차원에서 BianCang이 기존의 오픈 소스 의학 및 TCM LLM과 어떻게 비교되는가?
주요 결과
- BianCang은 증후군 구분, 질병 진단, 시험 및 의학 지식의 4개 작업에서 11개의 테스트 세트에 걸쳐 기존의 오픈 소스 TCM 및 중국 의학 LLM을 능가한다.
- TCMSD에서의 직접 추론 모드에서 BianCang-Qwen2.5-7B-Instruct는 78.90% 정확도와 CoT에서 82.10%를 달성하여 기준선 Qwen2.5-7B보다 현저히 높다.
- BianCang은 제로샷 및 파샷 시험 설정에서 견고한 성능 향상을 보여주며, BC-Analytical 평가에 따라 전문성, 유창성 및 안전성 측면에서 강한 주관적 평가를 나타낸다.
- 두 단계 학습 접근법(지속적 사전 학습 plus SFT)은 내재 지식과 지시 정렬 능력 간의 일관성을 개선하고 증후군 구분 및 진단 작업의 성능을 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.