[论文解读] Distributed Representation for Traditional Chinese Medicine Herb via Deep Learning Models
本文提出处方级别语言建模(PLLM)方法,通过将完整处方作为序列建模,学习中医草药的分布式表示,捕捉草药配伍规律。PLLM在性能上优于NLP风格的语言模型和初学者,与专家判断的斯皮尔曼等级相关系数达到0.5535,证明其在无监督学习中医草药关系方面的有效性。
Traditional Chinese Medicine (TCM) has accumulated a big amount of precious resource in the long history of development. TCM prescriptions that consist of TCM herbs are an important form of TCM treatment, which are similar to natural language documents, but in a weakly ordered fashion. Directly adapting language modeling style methods to learn the embeddings of the herbs can be problematic as the herbs are not strictly in order, the herbs in the front of the prescription can be connected to the very last ones. In this paper, we propose to represent TCM herbs with distributed representations via Prescription Level Language Modeling (PLLM). In one of our experiments, the correlation between our calculated similarity between medicines and the judgment of professionals achieves a Spearman score of 55.35 indicating a strong correlation, which surpasses human beginners (TCM related field bachelor student) by a big margin (over 10%).
研究动机与目标
- 为解决中医草药表示问题,以捕捉其配伍规律,这些规律并非如自然语言那样具有严格顺序。
- 开发一种深度学习方法,将整个中医处方作为整体单元进行建模,而非顺序性语句。
- 构建一个包含超过80,000份数字化中医处方的可扩展、高质量数据集,用于训练和评估草药表示。
- 探索利用深度学习辅助中医师配伍有效草药组合的可行性。
提出的方法
- 将每个中医处方视为草药标记的序列,将整个处方作为上下文,用于预测核心草药。
- 采用基于RNN的神经语言模型架构,基于完整处方上下文预测核心草药,实现整体表示学习。
- 在大规模中医数据集上训练时,应用早停法和Adam优化算法,防止过拟合。
- 使用掩码预测目标进行模型训练,即随机掩码一个草药,并根据周围上下文进行预测。
- 采用对称评分函数,结合前向和后向n-gram概率,提升预测鲁棒性。
- 利用分布式表示分析草药之间的代数关系,如类似word2vec的类比模式。
实验结果
研究问题
- RQ1处方级别语言建模方法是否能有效学习中医草药的有意义分布式表示,优于标准NLP语言建模方法?
- RQ2所学的草药嵌入与专家对草药配伍判断的相关性如何?
- RQ3该模型能否用于预测处方中缺失的草药,体现其在临床决策支持中的实际应用价值?
- RQ4所学嵌入是否表现出草药之间的类比关系,例如生品与炮制品之间?
- RQ5将整个处方作为整体单元进行建模,是否比仅建模局部序列依赖更有效?
主要发现
- PLLM模型与专家对草药配伍判断的斯皮尔曼等级相关系数达到0.5535,显著优于初学者(0.4506),提升超过10个百分点。
- PLLM模型在206份处方的测试集中,预测缺失草药的准确率达到32.04%,优于次佳模型(CBOW为20.39%)和N-gram基线(17.96%)。
- CBOW模型表现出意外优异(斯皮尔曼相关系数49.33%),表明全局上下文平均能捕捉有用模式,但PLLM的整体建模方式仍更优。
- 模型学习到了草药嵌入之间的线性代数关系,如v[熟地黄] - v[生地黄] ≈ v[煨姜] - v[生姜],表明具备类比推理潜力。
- 传统方法如LSA和GloVe表现欠佳(分别为38.61%和39.52%),可能因其依赖全局统计信息,忽略了局部草药相互作用。
- 结果表明,对处方进行整体建模是捕捉中医特有配伍规则的关键,而标准NLP方法难以有效建模此类规则。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。