Skip to main content
QUICK REVIEW

[论文解读] Affinity Network Fusion and Semi-supervised Learning for Cancer Patient Clustering

Tianle Ma, Aidong Zhang|arXiv (Cornell University)|May 22, 2018
Bioinformatics and Genomic Networks参考文献 6被引用 3
一句话总结

本文提出了一种名为亲和力网络融合(Affinity Network Fusion, ANF)的新方法,用于整合多组学数据(基因表达、miRNA、甲基化)以改善癌症患者的聚类分析与亚型发现。ANF 从每种组学数据类型构建基于 kNN 的亲和力网络,将它们融合为一个稳健的共识网络,并在仅使用不到 1% 标注数据的情况下,实现高精度的无监督聚类与半监督学习。

ABSTRACT

Defining subtypes of complex diseases such as cancer and stratifying patient groups with the same disease but different subtypes for targeted treatments is important for personalized and precision medicine. Approaches that incorporate multi-omic data are more advantageous to those using only one data type for patient clustering and disease subtype discovery. However, it is challenging to integrate multi-omic data as they are heterogeneous and noisy. In this paper, we present Affinity Network Fusion (ANF) to integrate multi-omic data for patient clustering. ANF first constructs patient affinity networks for each omic data type, and then calculates a fused network for spectral clustering. We applied ANF to a processed harmonized cancer dataset downloaded from GDC data portal consisting of 2193 patients, and generated promising results on clustering patients into correct disease types. Moreover, we developed a semi-supervised model combining ANF and neural network for few-shot learning. In several cases, the model can achieve greater than 90% acccuracy on test set with training less than 1% of the data. This demonstrates the power of ANF in learning a good representation of patients, and shows the great potential of semi-supervised learning in cancer patient clustering.

研究动机与目标

  • 解决异质性与噪声较多的多组学数据在癌症患者聚类与亚型发现中的整合挑战。
  • 开发一种比现有网络融合方法(如 SNF)更高效、更稳健的替代方案,降低计算复杂度,同时保持或提升性能。
  • 通过 ANF 学习到的患者表征,实现零样本与少样本学习,用于癌症患者分类。
  • 在来自 GDC 门户的大规模、标准化的癌症数据集上,展示 ANF 在生成可靠、具有生物学可解释性的患者聚类方面的有效性。
  • 探索 ANF 作为表示学习框架在半监督设置下用于迁移学习的潜力,结合深度神经网络进行应用。

提出的方法

  • 对每种组学数据类型,使用 k-最近邻(kNN)和高斯核变换构建患者亲和力网络,以降低噪声并捕捉非线性关系。
  • 采用加权组合策略,将多个独立的亲和力网络融合为一个单一的共识网络,突出不同视图之间的互补信息。
  • 在融合后的亲和力网络上应用谱聚类,获得患者聚类结果,无需标签数据,从而实现无监督的零样本学习。
  • 将 ANF 的输出作为全连接神经网络的输入特征,以实现仅使用少量标注样本的半监督学习。
  • 通过冻结低层权重(即已学习的表示)并仅更新最后几层来微调神经网络分类器,实现迁移学习。
  • 使用特征值间隔分析验证融合后亲和力网络的质量,确保其能反映真实的生物学亚型。

实验结果

研究问题

  • RQ1亲和力网络融合(ANF)能否有效整合异质性多组学数据,生成一个稳健、抗噪声的患者亲和力网络,以支持癌症聚类?
  • RQ2在真实世界癌症数据集上,ANF 与 SNF 等现有方法相比,在计算效率和聚类准确率方面表现如何?
  • RQ3基于 ANF 的表征在癌症患者分类的少样本学习中能发挥多大作用?达到高准确率需要多少标注数据?
  • RQ4通过 ANF 学习到的患者表征是否具有跨不同癌症类型的泛化能力?在半监督设置下能否有效用于迁移学习?
  • RQ5ANF 生成的融合亲和力网络是否与已知的生物学亚型一致?能否支持可靠的新癌症亚型发现?

主要发现

  • 与 SNF 相比,ANF 在保持或提升聚类性能的同时,显著降低了计算复杂度,在包含 2193 名患者的标准化癌症数据集上表现优异。
  • ANF 生成的融合亲和力网络与真实疾病亚型标签高度一致,并在特征值间隔分析中表现出强一致性,表明其聚类结构可靠。
  • 在半监督学习中,模型仅使用不到 1% 的训练数据,测试准确率即超过 90%,展现出强大的少样本学习能力。
  • 微调神经网络的倒数第二层相比仅微调最后一层,性能略有提升,尤其在使用三种组学视图(基因、miRNA、甲基化)时更为明显。
  • 即使仅在两种肾癌亚型上进行训练,基于 ANF 的表征在微调过程中仍能成功捕捉到潜在的三聚类结构。
  • 该方法对噪声具有鲁棒性,当使用通过无监督 ANF 和谱聚类生成的噪声样本进行训练数据增强时,性能依然保持强劲。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。