Skip to main content
QUICK REVIEW

[논문 리뷰] TCM-GPT: Efficient Pre-training of Large Language Models for Domain Adaptation in Traditional Chinese Medicine

Guoxing Yang, Jian‐Yu Shi|arXiv (Cornell University)|2023. 11. 03.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 전통중의약(TCM) 분야의 대규모 언어모델을 위한 도메인 적응형 사전학습 방법인 TCMDA를 제안한다. TCM 전용 10억 토큰 코퍼스(TCM-Corpus-1B)와 LoRA 미세조정을 활용하며, 결과적으로 70억 파라미터 모델인 TCM-GPT-7B가 TCM 진료 및 진단 과제에서 각각 17%와 12%의 상대 정확도 향상을 달성한다. 이는 TCM 분야에서의 도메인 특화 사전학습의 효과성을 입증한다.

ABSTRACT

Pre-training and fine-tuning have emerged as a promising paradigm across various natural language processing (NLP) tasks. The effectiveness of pretrained large language models (LLM) has witnessed further enhancement, holding potential for applications in the field of medicine, particularly in the context of Traditional Chinese Medicine (TCM). However, the application of these general models to specific domains often yields suboptimal results, primarily due to challenges like lack of domain knowledge, unique objectives, and computational efficiency. Furthermore, their effectiveness in specialized domains, such as Traditional Chinese Medicine, requires comprehensive evaluation. To address the above issues, we propose a novel domain specific TCMDA (TCM Domain Adaptation) approach, efficient pre-training with domain-specific corpus. Specifically, we first construct a large TCM-specific corpus, TCM-Corpus-1B, by identifying domain keywords and retreving from general corpus. Then, our TCMDA leverages the LoRA which freezes the pretrained model's weights and uses rank decomposition matrices to efficiently train specific dense layers for pre-training and fine-tuning, efficiently aligning the model with TCM-related tasks, namely TCM-GPT-7B. We further conducted extensive experiments on two TCM tasks, including TCM examination and TCM diagnosis. TCM-GPT-7B archived the best performance across both datasets, outperforming other models by relative increments of 17% and 12% in accuracy, respectively. To the best of our knowledge, our study represents the pioneering validation of domain adaptation of a large language model with 7 billion parameters in TCM domain. We will release both TCMCorpus-1B and TCM-GPT-7B model once accepted to facilitate interdisciplinary development in TCM and NLP, serving as the foundation for further study.

연구 동기 및 목표

  • 일반 목적의 LLM이 TCM 분야에서 성능이 열 劣한 데에는 도메인 특화 지식 부족과 계산 효율성 부족이 원인임을 해결하기 위해.
  • 효과적인 도메인 적응 사전학습을 가능하게 하기 위해 대규모 고품질의 TCM 전용 코퍼스를 구축하기 위해.
  • 기존 사전학습 가중치를 유지하면서도 TCM 특화 과제에 적응할 수 있는 효율적인 미세조정 전략을 개발하기 위해.
  • 실제 TCM NLP 과제, 예를 들어 진료 및 진단 과제에서 도메인 적응형 사전학습의 효과를 검증하기 위해.
  • 향후 TCM과 NLP 분야의 융합 연구를 지원하기 위해 TCM-Corpus-1B와 TCM-GPT-7B를 공개하기 위해.

제안 방법

  • 일반 도메인 코퍼스에서 TCM 关련 키워드를 식별하고, 관련 텍스트를 추출하여 TCM-Corpus-1B를 구축하였다.
  • 원본 모델 가중치를 동결하고, 낮은 랭크의 투영 행렬만 학습하는 LoRA(Low-Rank Adaptation) 기법을 적용하여 LLM을 미세조정하였다.
  • LoRA 기법을 활용해 추가 파라미터가 최소한인 상태에서 모델을 TCM 과제에 효율적으로 적응시켰다.
  • LoRA 기반 미세조정 절차를 사용하여 TCM-Corpus-1B에서 TCM-GPT-7B 모델을 사전학습 및 미세조정하였다.
  • 두 가지 TCM 전용 과제인 TCM 진료(다중선택지형) 및 TCM 진단(임상적 추론) 과제에서 모델을 평가하였다.
  • 개방형 연구 및 재현 가능성을 지원하기 위해 TCM-Corpus-1B와 TCM-GPT-7B를 모두 공개하였다.
Figure 1: The overview of TCMDA
Figure 1: The overview of TCMDA

실험 결과

연구 질문

  • RQ1도메인 특화 사전학습이 TCM NLP 과제에서 대규모 언어모델의 성능을 크게 향상시킬 수 있는가?
  • RQ2제한된 레이블 데이터에서 LoRA 기반 미세조정 기법이 일반 LLM을 TCM 도메인에 효과적으로 적응시키는 데 얼마나 유용한가?
  • RQ3대규모로 구축된 정제된 TCM 코퍼스가 모델 일반화 능력과 TCM 추론의 사실적 일관성에 어떤 영향을 미치는가?
  • RQ4도메인 적응 후 70억 파라미터 LLM이 TCM 관련 과제에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5도메인 적응된 TCM-GPT-7B는 무작위 또는 비적응 모델 대비 정확하고 의미 있는 임상적 응답을 생성하는 데 얼마나 뛰어난가?

주요 결과

  • 기준 모델 대비 TCM-EXAM 데이터셋에서 TCM-GPT-7B가 17%의 상대 정확도 향상을 달성하였다.
  • TCM 진단 과제에서 TCM-GPT-7B는 경쟁 모델 대비 12%의 상대 정확도 향상을 보였다.
  • 사례 연구에서 모델는 '해소맥맥'(untwining rope pulse)을 정답으로 올바르게 식별하였고, 무작위 기준 모델은 잘못되게 '어상맥맥'(waving fish pulse)을 선택하였다.
  • LoRA 기반 적응 방법은 최소한의 파라미터 업데이트로 효율적인 미세조정을 가능하게 하였으며, 원본 모델의 지식을 유지하면서도 TCM 특화 용어와 논리에 적응할 수 있었다.
  • TCM-Corpus-1B 코퍼스는 모델가 TCM 임상 추론에서 사실에 기반하고 맥락에 적절한 응답을 생성하는 능력을 크게 향상시켰다.
  • 저자들의 최선의 지식에 비추어 볼 때, 이는 실제 과제에서 검증된 바 있는 TCM 도메인에서 70억 파라미터 LLM의 첫 성공적인 도메인 적응 사례이다.
Figure 2: The Impact of Corpus Size on Performance
Figure 2: The Impact of Corpus Size on Performance

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.