[論文レビュー] TCM-GPT: Efficient Pre-training of Large Language Models for Domain Adaptation in Traditional Chinese Medicine
本稿では、伝統的中国医学(TCM)分野における大規模言語モデルのドメイン適応的事前学習手法であるTCMDAを提案する。本手法は、10億トークンにのぼるTCM特化コーパス(TCM-Corpus-1B)とLoRA微調整を用いる。得られた70億パラメータのモデル、TCM-GPT-7Bは、TCM診断および診察タスクでそれぞれ17%および12%の相対的精度向上を達成し、TCM分野における特化型事前学習の有効性を示している。
Pre-training and fine-tuning have emerged as a promising paradigm across various natural language processing (NLP) tasks. The effectiveness of pretrained large language models (LLM) has witnessed further enhancement, holding potential for applications in the field of medicine, particularly in the context of Traditional Chinese Medicine (TCM). However, the application of these general models to specific domains often yields suboptimal results, primarily due to challenges like lack of domain knowledge, unique objectives, and computational efficiency. Furthermore, their effectiveness in specialized domains, such as Traditional Chinese Medicine, requires comprehensive evaluation. To address the above issues, we propose a novel domain specific TCMDA (TCM Domain Adaptation) approach, efficient pre-training with domain-specific corpus. Specifically, we first construct a large TCM-specific corpus, TCM-Corpus-1B, by identifying domain keywords and retreving from general corpus. Then, our TCMDA leverages the LoRA which freezes the pretrained model's weights and uses rank decomposition matrices to efficiently train specific dense layers for pre-training and fine-tuning, efficiently aligning the model with TCM-related tasks, namely TCM-GPT-7B. We further conducted extensive experiments on two TCM tasks, including TCM examination and TCM diagnosis. TCM-GPT-7B archived the best performance across both datasets, outperforming other models by relative increments of 17% and 12% in accuracy, respectively. To the best of our knowledge, our study represents the pioneering validation of domain adaptation of a large language model with 7 billion parameters in TCM domain. We will release both TCMCorpus-1B and TCM-GPT-7B model once accepted to facilitate interdisciplinary development in TCM and NLP, serving as the foundation for further study.
研究の動機と目的
- 一般向けLLMがTCM分野で性能が低いのは、ドメイン特化知識の欠如と計算効率の悪さに起因するため、これを是正すること。
- 効果的なドメイン適応のための、大規模かつ高品質なTCM特化コーパスを構築すること。
- 事前学習済み重みを保持しつつ、TCM特化タスクに適応できる効率的な微調整戦略を開発すること。
- 診断や診察といった実世界のTCM NLPタスクにおいて、ドメイン適応的事前学習の有効性を検証すること。
- 今後のTCMとNLP分野の横断的研究を支援するため、TCM-Corpus-1BおよびTCM-GPT-7Bを公開すること。
提案手法
- 一般ドメインコーパスから関連するテキストを抽出することで、TCMキーワードを特定し、TCM-Corpus-1Bを構築した。
- 元のモデル重みを凍結し、低ランク射影行列のみを学習することで、LoRA(低ランク適応)を用いてLLMを微調整した。
- LoRA技術を活用し、追加パラメータを最小限に抑えながら、モデルをTCMタスクに効率的に適応させた。
- LoRA適応学習手順を用いて、TCM-Corpus-1B上でTCM-GPT-7Bモデルの事前学習および微調整を実施した。
- 2つのTCM特化タスク、TCM診察(複数選択式)およびTCM診断(臨床的推論)の評価を実施した。
- 研究の再現性とオープンな研究を支援するため、TCM-Corpus-1BおよびTCM-GPT-7Bを公開した。

実験結果
リサーチクエスチョン
- RQ1特化型事前学習は、TCM NLPタスクにおける大規模言語モデルの性能を顕著に向上させることができるか?
- RQ2限られたラベル付きデータのもとで、LoRAベースの微調整は一般LLMをTCMドメインに効果的に適応させることができるか?
- RQ3大規模かつ精選されたTCMコーパスは、モデルの一般化能力およびTCM推論における事実整合性にどのような影響を与えるか?
- RQ4ドメイン適応を経た70億パラメータのLLMは、TCM関連タスクで最先端の性能を達成できるか?
- RQ5ドメイン適応済みのTCM-GPT-7Bは、ランダムまたは非適応モデルと比較して、正確で意味のある臨床的応答を生成できるか?
主な発見
- TCM-GPT-7Bは、ベースラインモデルと比較して、TCM-EXAMデータセットで17%の相対的精度向上を達成した。
- TCM診断タスクにおいて、競合モデルと比較して12%の相対的精度向上を示した。
- 事例研究では、モデルは正しく「解索脈」(解きほぐすロープのうなず)を正解と特定したが、ランダムベースラインは誤って「魚翔脈」(波打つ魚のうなず)を選択した。
- LoRAベースの適応手法により、最小限のパラメータ更新で効率的な微調整が可能となり、元のモデルの知識を保持しながら、TCM特化用語および論理に適応した。
- TCM-Corpus-1Bコーパスは、TCM臨床的推論において事実に基づき、文脈的に適切な応答を生成する能力を顕著に向上させた。
- 著者らの知る限り、本稿は、実世界のタスクで検証された、70億パラメータのLLMがTCMドメインで初めて成功裏にドメイン適応を達成した事例である。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。