Skip to main content
QUICK REVIEW

[论文解读] Unsupervised learning with GLRM feature selection reveals novel traumatic brain injury phenotypes

Aaron J. Masino, Kaitlin A. Folweiler|arXiv (Cornell University)|Nov 30, 2018
Machine Learning in Healthcare参考文献 23被引用 6
一句话总结

本研究提出了一种基于广义低秩模型(GLRM)的无监督机器学习框架,用于特征选择与聚类,旨在从临床数据中识别创伤性脑损伤(TBI)的新表型。该方法揭示了四种具有独特基线特征谱的TBI亚型,其与90天功能及认知结局显著相关,优于标准的格拉斯哥昏迷量表(GCS)分类。

ABSTRACT

Baseline injury categorization is important to traumatic brain injury (TBI) research and treatment. Current categorization is dominated by symptom-based scores that insufficiently capture injury heterogeneity. In this work, we apply unsupervised clustering to identify novel TBI phenotypes. Our approach uses a generalized low-rank model (GLRM) model for feature selection in a procedure analogous to wrapper methods. The resulting clusters reveal four novel TBI phenotypes with distinct feature profiles and that correlate to 90-day functional and cognitive status.

研究动机与目标

  • 为解决基于症状的TBI分类方法的局限性,例如对格拉斯哥昏迷量表(GCS)的依赖,该方法无法捕捉损伤异质性且与长期结局关联性差。
  • 开发一种数据驱动且可解释的方法,利用无监督机器学习识别具有生物学意义的TBI表型。
  • 通过发现具有独特基线特征和预后意义的亚型,改进TBI研究与临床试验设计。

提出的方法

  • 采用两阶段流程:首先,GLRM通过使用L1正则化优化对患者数据矩阵进行低秩分解,实现特征选择,以识别最具信息量的特征。
  • GLRM采用秩-2分解,对数值特征使用平方损失,对二值特征使用合页损失,并按特征方差进行缩放,以实现不同测量单位间的归一化。
  • 对特征系数矩阵Y施加L1正则化,以促进稀疏性,从而仅从原始98个特征中选择最相关的特征,减少过拟合,同时保持可解释性。
  • 使用选定的12个特征,通过基于中位数的分区聚类(PAM)将991名TBI患者聚类为四种类群。
  • 通过5折交叉验证结合成对相似性指数,验证聚类稳定性,以评估聚类成员的一致性。
  • 使用Kruskal-Wallis检验和Holm多重比较检验分析连续特征的组间差异,使用卡方检验分析分类变量的组间差异。

实验结果

研究问题

  • RQ1基于GLRM的无监督学习能否识别出比当前临床标准更具预测力的新颖、具有生物学意义的TBI表型?
  • RQ2哪些基线临床特征对区分TBI亚型和长期功能状态最具预测力?
  • RQ3与基于GCS的分类相比,所识别的TBI表型在临床特征谱和90天结局方面有何差异?
  • RQ4所识别的表型结构在不同数据划分下具有多大程度的稳健性与可重复性?

主要发现

  • GLRM特征选择过程保留了13个初始特征,剔除INR后减少至12个,最终模型使用净液体摄入量、红细胞压积、血红蛋白、血小板、白细胞、葡萄糖、谷丙转氨酶、凝血酶原时间、活化部分凝血活酶时间、INR、CT上中脑池异常以及作为损伤机制的跌倒。
  • 识别出四种不同的TBI表型:A类(n=314)、B类(n=204)、C类(n=286)和D类(n=187),每类均具有独特的基线特征谱。
  • 所有四类在基线特征上均存在显著差异(p < 0.05,Kruskal-Wallis检验),其中B类表现出更高的出血和凝血功能障碍风险标志物。
  • 12项90天功能与认知结局评分中有9项在不同类群间存在显著差异(p < 0.05),表明表型具有强大的预后价值。
  • 相比之下,按GCS评分分组的患者在基线特征或90天结局上均无显著差异,凸显了当前临床分类方法的局限性。
  • 该方法表现出高度的聚类稳定性,训练集与验证集之间的成对相似性指数为0.92,表明对数据划分具有强稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。