Skip to main content
QUICK REVIEW

[论文解读] Multi-View Multiple Clusterings using Deep Matrix Factorization

Shaowei Wei, Jun Wang|arXiv (Cornell University)|Nov 26, 2019
Face and Expression Recognition参考文献 36被引用 8
一句话总结

该论文提出 DMClusts,一种深度矩阵分解框架,通过逐层分解数据矩阵并引入平衡冗余度量项以实现多样性,从而从多视图数据中发现多个多样化且高质量的聚类。实验表明,DMClusts 在基准数据集上的聚类质量和多样性方面均优于最先进方法。

ABSTRACT

Multi-view clustering aims at integrating complementary information from multiple heterogeneous views to improve clustering results. Existing multi-view clustering solutions can only output a single clustering of the data. Due to their multiplicity, multi-view data, can have different groupings that are reasonable and interesting from different perspectives. However, how to find multiple, meaningful, and diverse clustering results from multi-view data is still a rarely studied and challenging topic in multi-view clustering and multiple clusterings. In this paper, we introduce a deep matrix factorization based solution (DMClusts) to discover multiple clusterings. DMClusts gradually factorizes multi-view data matrices into representational subspaces layer-by-layer and generates one clustering in each layer. To enforce the diversity between generated clusterings, it minimizes a new redundancy quantification term derived from the proximity between samples in these subspaces. We further introduce an iterative optimization procedure to simultaneously seek multiple clusterings with quality and diversity. Experimental results on benchmark datasets confirm that DMClusts outperforms state-of-the-art multiple clustering solutions.

研究动机与目标

  • 为解决现有多视图聚类方法通常仅关注单一聚类而难以支持从多视图数据中发现多个有意义且多样化的聚类这一挑战。
  • 开发一种能有效融合多个异构视图中的共识与互补信息,同时对噪声或低质量视图具有鲁棒性的方法。
  • 通过联合量化样本在不同聚类中被分组或分离时的冗余度,实现多个聚类之间的多样性。
  • 设计一种高效且可扩展的解决方案,避免现有方法中相似度矩阵分解带来的计算负担。

提出的方法

  • DMClusts 采用深度矩阵分解,逐层迭代地将多视图数据矩阵分解为表示子空间,每层生成一个聚类结果。
  • 提出一种新颖的平衡冗余度量项,联合衡量两个样本在不同聚类中被分组在一起或被分隔开时的冗余度,以促进全面的多样性。
  • 通过迭代优化过程,同时学习高质量且低冗余的多个聚类,平衡多样性与聚类性能之间的权衡。
  • 通过可学习参数 $ r $ 为不同视图分配不同权重,使模型能够降低无关或噪声视图的影响,提升鲁棒性。
  • 框架引入超参数 $ \lambda $,用于平衡聚类质量(通过矩阵分解)与多样性(通过冗余控制)之间的权衡。
  • 采用端到端训练方式,通过最小化重构误差与冗余度的联合目标函数进行优化,且通过迭代优化保证收敛。

实验结果

研究问题

  • RQ1深度矩阵分解框架能否有效从多视图数据中生成多个多样化且高质量的聚类?
  • RQ2如何量化多个聚类之间的冗余度,以同时捕捉样本的共现与分离模式?
  • RQ3所提出的平衡冗余项(同时考虑同簇与异簇分组)是否相比现有方法能带来更好的多样性?
  • RQ4在聚类质量与多样性方面,该模型相较于最先进多聚类与多视图聚类方法表现如何?
  • RQ5通过 $ r $ 参数为噪声或低质量视图分配较低权重,该框架是否能有效处理此类视图?

主要发现

  • DMClusts 在聚类质量(Davies-Bouldin Index)与多样性(1-NMI)方面显著优于最先进多聚类方法,在基准数据集上表现出卓越的有效性。
  • 平衡冗余度量项在 $ \beta \in [0.3, 0.7] $ 范围内取得最高多样性(NMI ≈ 0.064),优于 $ \beta = 0 $ 或 $ \beta = 1 $ 的极端值,证明其在捕捉互补冗余模式方面的有效性。
  • 参数 $ \lambda $ 控制质量与多样性之间的权衡:增大 $ \lambda $ 可提升多样性但降低聚类质量,证实了该权衡关系的存在及其超参数的必要性。
  • 模型在不同 $ r $ 值下保持稳定性能,中等大小 $ r $(如 $ r > 0.05 $)通过实现视图特定加权提升了多样性;而过小的 $ r $ 导致等权重分配,降低多样性。
  • DMClusts 实现了效率与性能的良好平衡,运行时间适中且可扩展,相较于基于相似度矩阵的方法更适合大规模数据集。
  • 消融研究证实,所提出的冗余项(同时考虑同簇与异簇冗余)显著提升了聚类多样性,优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。