Skip to main content
QUICK REVIEW

[论文解读] Unsupervised shape and motion analysis of 3822 cardiac 4D MRIs of UK Biobank

Qiao Zheng, Hervé Delingette|arXiv (Cornell University)|Feb 15, 2019
Radiomics and Machine Learning in Medical Imaging参考文献 33被引用 4
一句话总结

本研究提出了一种基于深度学习提取的形态与运动特征,对英国生物样本库中3,822例心脏4D MRI进行无监督聚类分析。在特征选择后使用高斯混合模型,识别出两个明显不同的聚类,可能代表了病理性心脏表型,通过分类模型和降维技术得到验证,表明无监督分析在大规模未标注医学影像数据集中的潜力。

ABSTRACT

We perform unsupervised analysis of image-derived shape and motion features extracted from 3822 cardiac 4D MRIs of the UK Biobank. First, with a feature extraction method previously published based on deep learning models, we extract from each case 9 feature values characterizing both the cardiac shape and motion. Second, a feature selection is performed to remove highly correlated feature pairs. Third, clustering is carried out using a Gaussian mixture model on the selected features. After analysis, we identify two small clusters which probably correspond to two pathological categories. Further confirmation using a trained classification model and dimensionality reduction tools is carried out to support this discovery. Moreover, we examine the differences between the other large clusters and compare our measures with the ground-truth.

研究动机与目标

  • 对英国生物样本库中的大规模未标注心脏MRI数据集进行无监督分析。
  • 在不依赖专家标注数据的情况下,识别潜在的病理亚型。
  • 评估聚类在从图像衍生特征中检测异常心脏表型方面的有效性。
  • 通过分类模型和降维等附加机器学习工具验证所发现聚类的解释。
  • 展示无监督学习在大规模医学影像数据中检测心脏病理的可行性。

提出的方法

  • 使用先前发表的基于深度学习的特征提取流程,每例病例提取9个形态与运动特征。
  • 执行特征选择以消除高度相关的特征对,提升聚类稳定性。
  • 应用高斯混合模型(GMM)基于所选特征对病例进行无监督聚类。
  • 利用训练好的分类模型评估聚类的病理可能性,以验证聚类解释。
  • 采用降维技术(PCA与t-SNE)可视化并确认聚类的分离性与结构。
  • 将自动流程生成的测量值与InlineVF算法的真值进行比较,以评估可靠性并识别异常值。

实验结果

研究问题

  • RQ1无监督聚类是否能从大规模未标注心脏MRI数据集中,通过图像衍生的形态与运动特征检测出病理亚型?
  • RQ2所识别的聚类是否对应于临床上有意义的心脏病理?
  • RQ3基于特征的聚类结果与真值射血分数和容积测量值相比如何?
  • RQ4降维与分类模型在多大程度上支持对聚类的病理学解释?
  • RQ5自动流程估计值与真值之间的差异是否主要由数据质量问题导致?

主要发现

  • 识别出两个小聚类,基于聚类结果与训练分类器的验证,很可能对应于病理性心脏类别。
  • t-SNE与PCA可视化结果确认了这两个聚类与更大规模、 presumably 健康群体的显著分离。
  • 自动流程在舒张末期的左心室容积估计值平均比真值低7.0%,而在收缩末期则低40.8%。
  • 稳健线性回归显示自动流程与真值测量值之间具有高度一致性,回归线与恒等线高度吻合。
  • 真值数据中的异常值——可能源于InlineVF算法的失败——被识别为自动估计与真值之间差异的主要来源。
  • 本研究证明,对大规模未标注数据集进行无监督学习,可在无需预先标注的情况下揭示具有临床意义的亚型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。