[论文解读] TCM-SD: A Benchmark for Probing Syndrome Differentiation via Natural Language Processing
本文提出了TCM-SD,这是首个基于自然语言处理(NLP)的中医证候辨证(SD)公开大规模基准,包含54,152份真实临床记录,涵盖148种证候。研究提出了领域专用的预训练语言模型ZY-BERT,并建立了强基准模型,表明知识注入与领域专用预训练能显著提升辨证性能,尤其在处理复杂推理和罕见中医术语方面表现突出。
Traditional Chinese Medicine (TCM) is a natural, safe, and effective therapy that has spread and been applied worldwide. The unique TCM diagnosis and treatment system requires a comprehensive analysis of a patient's symptoms hidden in the clinical record written in free text. Prior studies have shown that this system can be informationized and intelligentized with the aid of artificial intelligence (AI) technology, such as natural language processing (NLP). However, existing datasets are not of sufficient quality nor quantity to support the further development of data-driven AI technology in TCM. Therefore, in this paper, we focus on the core task of the TCM diagnosis and treatment system -- syndrome differentiation (SD) -- and we introduce the first public large-scale dataset for SD, called TCM-SD. Our dataset contains 54,152 real-world clinical records covering 148 syndromes. Furthermore, we collect a large-scale unlabelled textual corpus in the field of TCM and propose a domain-specific pre-trained language model, called ZY-BERT. We conducted experiments using deep neural networks to establish a strong performance baseline, reveal various challenges in SD, and prove the potential of domain-specific pre-trained language model. Our study and analysis reveal opportunities for incorporating computer science and linguistics knowledge to explore the empirical validity of TCM theories.
研究动机与目标
- 为解决中医(TCM)证候辨证(SD)缺乏高质量、大规模数据集的问题,该问题阻碍了中医领域数据驱动的AI发展。
- 建立一个标准化、公开可用的中医NLP任务基准,特别聚焦于证候辨证这一核心诊断过程。
- 开发并验证一个专为中医临床文本设计的领域专用预训练语言模型(ZY-BERT),以提升下游证候辨证任务的性能。
- 揭示中医证候辨证中的关键挑战,包括罕见术语、隐含推理和知识匮乏,并评估外部知识与模型架构的影响。
提出的方法
- 构建了一个大规模、真实世界的临床数据集,包含54,152份中医记录,覆盖148种不同证候,并对证候辨证进行了标注。
- 从公开医疗网站收集了大规模、未标注的中医专用文本语料,以支持领域专用预训练。
- 提出ZY-BERT,一种基于BERT的领域适配语言模型,在中医语料上进行预训练,以更好地捕捉中医特有的语言与语义模式。
- 在TCM-SD数据集上微调多种深度学习模型(如BERT、RoBERTa),评估其在不同输入格式(主诉、病史或两者兼有)下的性能,建立强基准。
- 通过消融研究分析不同输入模态(主诉与病史)的贡献,以及外部知识检索的影响。
- 采用基于TF-IDF的知识检索方法增强模型输入,评估其对性能的影响,并揭示知识对齐方面的挑战。
实验结果
研究问题
- RQ1标准NLP模型(如BERT、RoBERTa)在真实中医临床文本上的证候辨证任务中泛化性能如何?
- RQ2在多大程度上,整合外部知识能提升中医证候分类的准确率与鲁棒性?
- RQ3中医证候辨证中的关键挑战(如隐含推理、罕见术语或知识匮乏)及其对模型性能的影响是什么?
- RQ4与通用模型相比,领域专用预训练语言模型(ZY-BERT)在捕捉中医特异性语义方面的有效性如何?
- RQ5以粗到细的方式整合病史与主诉,是否能显著提升证候分类性能,超越单独使用任一模态的效果?
主要发现
- 在完整TCM-SD数据集上微调的RoBERTa模型在测试集上达到82.26%的准确率与47.55%的宏F1分数,为未来研究建立了强有力的基线。
- 当仅使用主诉时,性能显著下降(准确率:71.58%),凸显完整临床病史在证候辨证中的重要性。
- 通过TF-IDF检索引入外部知识可提升性能,但P@5仅为3.94%,表明中医NLP中的知识检索仍是重大挑战。
- 消融研究证实,主诉与病史均具有独特贡献,其中病史提供了更丰富的分类特征。
- 错误分析显示,模型在低资源证候、复杂推理(如时间、否定或数值推理)以及未登录的中医特有术语方面表现最弱。
- 本研究证明,使用ZY-BERT进行领域专用预训练可显著增强模型对中医临床文本的理解,尤其在处理罕见与领域特异性术语方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。