[论文解读] Hengqin-RA-v1: Advanced Large Language Model for Diagnosis and Treatment of Rheumatoid Arthritis with Dataset based Traditional Chinese Medicine
Hengqin-RA-v1 是首个专为中医(TCM)风湿性关节炎(RA)诊断与治疗而微调的大语言模型(LLM),基于从古典中医文献与现代临床研究中提取的新型 HQ-GCM-RA-C1 数据集。其在中文中医考试中取得了 54% 的通过率,显著优于其他大语言模型,包括增强版的 GPT-3.5 和 Huatuo-2-7B,展现出在 TCM 领域针对 RA 的卓越准确性和专业领域知识。
Large language models (LLMs) primarily trained on English texts, often face biases and inaccuracies in Chinese contexts. Their limitations are pronounced in fields like Traditional Chinese Medicine (TCM), where cultural and clinical subtleties are vital, further hindered by a lack of domain-specific data, such as rheumatoid arthritis (RA). To address these issues, this paper introduces Hengqin-RA-v1, the first large language model specifically tailored for TCM with a focus on diagnosing and treating RA. We also present HQ-GCM-RA-C1, a comprehensive RA-specific dataset curated from ancient Chinese medical literature, classical texts, and modern clinical studies. This dataset empowers Hengqin-RA-v1 to deliver accurate and culturally informed responses, effectively bridging the gaps left by general-purpose models. Extensive experiments demonstrate that Hengqin-RA-v1 outperforms state-of-the-art models, even surpassing the diagnostic accuracy of TCM practitioners in certain cases.
研究动机与目标
- 解决中医风湿性关节炎(RA)领域缺乏高质量、特定领域的中文医学语料的问题。
- 克服通用大语言模型(LLMs)在处理文化背景复杂、临床精确的中医诊断与治疗建议方面的局限性。
- 开发专用大语言模型 Hengqin-RA-v1,使其在中医 RA 诊断与治疗规划方面达到或超越人类专家水平。
- 创建并发布 HQ-GCM-RA-C1,这是首个全面、经筛选的中医风湿性关节炎中文语料库,包含古典文献、考试题目与临床数据。
- 建立评估 LLM 在中医特定医学推理能力的基准,尤其针对古汉语与复杂诊断逻辑。
提出的方法
- 采用渐进式训练流程:从 HQ-GCM-RA-C1 数据集出发,依次进行数据分割、对话数据集生成、全量微调与 LoRA 适配。
- 应用增量微调,选择性更新参数,同时保留先前知识,实现对新数据的持续适应。
- 整合基于实例与基于实体关系的检索增强技术,以提升上下文相关性与诊断推理能力。
- 通过结构化病历与滑动窗口机制,优化中医诊断逻辑,确保长上下文推理中的连贯性与准确性。
- 采用标准化中文中医考试对模型进行评估,性能以正确答案数与总题数之比(准确率)衡量。
- 应用数据增强与领域特定预训练,以提升模型泛化能力,并减少中文医学语言理解中的偏差。

实验结果
研究问题
- RQ1在经筛选的、针对风湿性关节炎的中医专用数据集上微调的大语言模型,是否能在诊断与治疗建议方面显著优于通用大语言模型?
- RQ2在训练语料中包含古典中医文献与现代临床数据,是否能显著提升模型在中医诊断中的准确率与文化语境理解能力?
- RQ3Hengqin-RA-v1 在运用中医原则诊断与治疗 RA 时,与人类中医从业者及其他最先进 LLM 相比表现如何?
- RQ4数据增强与专业微调技术对模型通过标准化中医考试的能力有何影响?
- RQ5基于全面、多源中文语料库训练的领域专用 LLM,是否能有效减少通用模型中存在的语言与文化偏差?
主要发现
- Hengqin-RA-v1 在中文中医考试中达到 54% 的通过率,显著优于其他 LLM,包括 GPT-3.5 (+) 的 37% 与 Huatuo-2-7B (*) 的 37%。
- 该模型超越了所有评估中的中文与非中文 LLM,包括数据增强变体,证明其专业化训练与领域特定数据的有效性。
- Hengqin-RA-v1 在特定测试案例中的诊断准确率超过部分人类中医从业者,表明其在临床推理方面具有高度可靠性。
- HQ-GCM-RA-C1 数据集(包含古典文献、考试题目与现代临床研究)在实现模型高性能与上下文准确性方面起到了关键作用。
- 研究发现,即使在使用领域专用语料训练后,语言复杂性(如古汉语、同音词与多义词)仍是 LLM 的主要挑战。
- 结果强调了精心筛选、高质量且具有文化根基的语料库在推动传统医学专用 LLM 发展中的关键作用,同时有助于减少医疗人工智能中的偏差。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。