[论文解读] Transferring Knowledge from Text to Predict Disease Onset
该论文提出了一种新方法,通过从生物医学文本语料库迁移知识以估计特征相关性,从而在低数据设置下提升疾病发病预测性能。利用领域特定文本的word2vec嵌入,对特征进行重标度,以减少对更相关特征的正则化,使AUC最高提升0.065,同时将特征数量减少60%,尤其在正样本较少时效果显著。
In many domains such as medicine, training data is in short supply. In such cases, external knowledge is often helpful in building predictive models. We propose a novel method to incorporate publicly available domain expertise to build accurate models. Specifically, we use word2vec models trained on a domain-specific corpus to estimate the relevance of each feature's text description to the prediction problem. We use these relevance estimates to rescale the features, causing more important features to experience weaker regularization. We apply our method to predict the onset of five chronic diseases in the next five years in two genders and two age groups. Our rescaling approach improves the accuracy of the model, particularly when there are few positive examples. Furthermore, our method selects 60% fewer features, easing interpretation by physicians. Our method is applicable to other domains where feature and outcome descriptions are available.
研究动机与目标
- 解决医学预测建模中训练数据有限的挑战,特别是针对罕见病或慢性病。
- 利用公开的生物医学文本语料库,估计每个特征描述与结果预测任务的相关性。
- 通过基于估计相关性的特征重标度,提升模型性能与可解释性,减少过拟合与特征数量。
- 开发一种可推广至生物医学以外领域的通用方法,适用于具备特征与结果描述的场景。
提出的方法
- 在领域特定的生物医学语料库上训练word2vec模型,将特征描述与结果描述嵌入为密集向量表示。
- 计算每个特征描述嵌入与结果描述嵌入之间的余弦相似度,以估计相关性。
- 将估计的相关性得分用作自适应缩放因子,对特征矩阵进行重标度,从而实现特征特定的正则化。
- 在逻辑回归模型中应用重标度后的特征,并使用L1正则化进行最终预测。
- 通过交叉验证调整相关性得分的幂平均指数,以优化性能。
- 在多种不同数据规模的疾病预测任务中,将该方法与标准的L1正则化逻辑回归进行对比。
实验结果
研究问题
- RQ1来自公开生物医学文本语料库的知识是否能提升低数据医学设置下的预测性能?
- RQ2与标准特征选择或正则化相比,使用文本衍生的相关性估计对特征进行处理,在AUC和特征数量方面表现如何?
- RQ3当训练数据严重受限(如仅有25个正样本)时,该方法是否仍能保持或提升性能?
- RQ4该方法在保留或提升预测准确性的同时,能在多大程度上降低特征维度?
- RQ5该方法在不同患者亚群(如性别和年龄组)中的性能表现如何?
主要发现
- 与标准L1正则化逻辑回归相比,该方法在AUC上最高提升0.065,所有显著改进任务的平均AUC为0.697,而标准方法为0.656。
- 在完整数据集中,该方法平均选择20个特征,而标准方法为50个,特征数量减少60%。
- 在仅有25个正样本的情况下,该方法的平均AUC为0.658,而标准方法为0.606,表明在极端数据稀缺条件下仍具优异表现。
- 该方法优先剔除低相关性特征——例如诊断码373.11(外眼腺炎)——这些特征被标准方法选中,但其相关性得分仅为0.57。
- 性能提升在数据稀缺程度更高的任务中最为显著,表明该方法在训练数据有限时尤为有效。
- 该方法在多种慢性病预测(如中风、糖尿病、心脏病)中均表现出一致的性能提升,且在不同亚群(性别与年龄组)中表现稳定。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。