Skip to main content
QUICK REVIEW

[论文解读] Robust Multiple Kernel k-means Clustering using Min-Max Optimization

Seojin Bang, Yaoliang Yu|arXiv (Cornell University)|Mar 6, 2018
Face and Expression Recognition参考文献 1被引用 7
一句话总结

本文提出 MML-MKKC,一种鲁棒的多核 k-均值聚类方法,采用极小-极大优化框架,以抵御多视图学习中的对抗性扰动。通过将核系数优化表述为对最坏情况扰动的最大化,该方法确保聚类不会因噪声或对抗性视图而偏移,在模拟实验和真实世界癌症亚型识别中均优于现有极小-极小方法。

ABSTRACT

Multiple kernel learning is a type of multiview learning that combines different data modalities by capturing view-specific patterns using kernels. Although supervised multiple kernel learning has been extensively studied, until recently, only a few unsupervised approaches have been proposed. In the meanwhile, adversarial learning has recently received much attention. Many works have been proposed to defend against adversarial examples. However, little is known about the effect of adversarial perturbation in the context of multiview learning, and even less in the unsupervised case. In this study, we show that adversarial features added to a view can make the existing approaches with the min-max formulation in multiple kernel clustering yield unfavorable clusters. To address this problem and inspired by recent works in adversarial learning, we propose a multiple kernel clustering method with the min-max framework that aims to be robust to such adversarial perturbation. We evaluate the robustness of our method on simulation data under different types of adversarial perturbations and show that it outperforms several compared existing methods. In the real data analysis, We demonstrate the utility of our method on a real-world problem.

研究动机与目标

  • 研究现有无监督多视图聚类方法在核学习中对对抗性扰动的脆弱性。
  • 识别出多核 k-均值聚类中标准的 min-H - min-theta 公式对引入噪声或冗余特征的对抗性视图具有敏感性。
  • 开发一种鲁棒聚类框架,即使部分视图被对抗性特征污染,也能保持性能。
  • 在具有受控对抗性扰动的模拟数据和真实世界生物数据(用于癌症亚型发现)上评估该方法。

提出的方法

  • 提出一种 min-H - max-theta 优化框架,其中内层最大化用于识别使类内方差最大的最坏情况核组合。
  • 外层最小化用于寻找使最坏情况类内方差最小的聚类分配 H,从而确保对对抗性视图的鲁棒性。
  • 在核系数 θ 上引入 l2 正则化,以防止过拟合并提升泛化能力。
  • 采用块坐标下降方法交替优化 H(聚类分配)和 θ(核权重)。
  • 采用受深度学习对抗训练启发的极小-极大公式,但针对无监督多视图聚类进行了适配。
  • 采用一种鲁棒优化策略,在核系数学习过程中将对抗性视图视为最坏情况场景。

实验结果

研究问题

  • RQ1对抗性扰动(如随机噪声或冗余特征)是否显著降低现有多核 k-均值聚类方法的性能?
  • RQ2与标准的 min-H - min-theta 方法相比,min-H - max-theta 优化框架是否能提升对对抗性视图的鲁棒性?
  • RQ3所提出的 MML-MKKC 方法在具有不同水平对抗性扰动的模拟数据上的表现如何?
  • RQ4在真实世界数据中,该方法能否有效利用所有视图(包括带有对抗性特征的视图)来识别具有生物意义的聚类?
  • RQ5在 BRCA 和 GBM 转录组数据上,该方法的聚类结果可提取出哪些生物学见解?

主要发现

  • 所提出的 MML-MKKC 方法在对抗性扰动下,显著优于现有 min-min 多核 k-均值方法,在调整兰德指数(adjRI)、标准化互信息(normMI)和纯度方面表现更优。
  • 在每视图含 20 个冗余变量的模拟数据中,MML-MKKC 达到 adjRI = 1.000、normMI = 1.443、纯度 = 1.000,优于所有基线方法。
  • 在对抗性特征存在时,标准的 min-min 方法通常忽略被扰动的视图,过度依赖其他视图,导致聚类性能次优。
  • 在真实 BRCA 和 GBM 数据中,MML-MKKC 成功识别出 KEGG 通路如“黏着斑”和“细胞外基质-受体相互作用”,其调整后 p 值 < 0.1,表明显著富集。
  • 在最佳模拟情形下,该方法实现了 100% 纯度和 1.000 的 adjRI,表明在使用所有视图(包括对抗性视图)时,聚类近乎完美。
  • 通路富集分析显示,MML-MKKC 的聚类结果在 BRCA 和 GBM 数据集中均显著富集于与癌症相关的通路,如“MAPK 信号转导”和“PI3K-Akt 信号通路”。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。