Skip to main content
QUICK REVIEW

[论文解读] Shared Generative Latent Representation Learning for Multi-view Clustering

Ming Yin, Weitian Huang|arXiv (Cornell University)|Jul 23, 2019
Video Surveillance and Tracking Methods参考文献 39被引用 5
一句话总结

该论文提出DMVCVAE,一种基于变分自编码器与高斯混合先验的深度多视角聚类方法,通过联合优化视角特定的自编码器、非负融合权重和共享潜在空间,学习共享的生成潜在表征。该模型在小规模与大规模多视角数据集上均达到当前最优性能,在准确率、NMI和ARI指标上显著优于现有深度与浅层聚类方法。

ABSTRACT

Clustering multi-view data has been a fundamental research topic in the computer vision community. It has been shown that a better accuracy can be achieved by integrating information of all the views than just using one view individually. However, the existing methods often struggle with the issues of dealing with the large-scale datasets and the poor performance in reconstructing samples. This paper proposes a novel multi-view clustering method by learning a shared generative latent representation that obeys a mixture of Gaussian distributions. The motivation is based on the fact that the multi-view data share a common latent embedding despite the diversity among the views. Specifically, benefited from the success of the deep generative learning, the proposed model not only can extract the nonlinear features from the views, but render a powerful ability in capturing the correlations among all the views. The extensive experimental results, on several datasets with different scales, demonstrate that the proposed method outperforms the state-of-the-art methods under a range of performance criteria.

研究动机与目标

  • 为解决现有多视角聚类方法在处理大规模数据和样本重建性能差方面的局限性。
  • 通过学习能捕捉各视角间共识与互补信息的共享潜在空间,建模多视角数据的生成过程。
  • 通过在统一的VAE框架下联合优化深度自编码器、视角特定的融合权重和共享潜在分布,提升聚类性能。
  • 实现在多视角数据上具有优越可扩展性与重建能力的有效表征学习与聚类。

提出的方法

  • 该模型采用变分自编码器(VAE)框架,学习多个视角之间的共享潜在表征,假设所有视角都条件依赖于一个共同的潜在变量。
  • 采用高斯混合(MoG)分布作为共享潜在空间的先验,使模型能够捕捉复杂的数据分布与聚类结构。
  • 引入非负融合权重,以自适应方式组合不同视角的特征,与自编码器端到端联合学习,突出信息丰富的视角。
  • 通过变分推断进行模型训练,最小化观测多视角数据在VAE目标下的对数似然的下界。
  • 最终的聚类分配直接从共享潜在变量的后验分布中推导得出,实现端到端聚类。
  • 该框架支持小规模与大规模数据集,其可扩展性已在NUS-WIDE-Object上得到验证。

实验结果

研究问题

  • RQ1共享的生成潜在表征是否能提升在多个异构视角上的聚类性能?
  • RQ2如何联合优化深度自编码器与视角特定的融合权重,以增强多视角聚类中的表征学习?
  • RQ3通过高斯混合模型建模数据生成过程,是否能带来优于判别式或非生成式方法的聚类与重建性能?
  • RQ4所提出的方法是否能有效扩展到大规模多视角数据集,而现有方法因计算复杂度而失效?

主要发现

  • 在UCI digits、Caltech-7和ORL数据集上,DMVCVAE实现了95.70%的准确率、91.66%的NMI和91.07%的ARI,显著优于所有浅层与深度基线方法。
  • 在Caltech-7数据集上,该方法实现了80.14%的准确率、85.38%的NMI和70.48%的ARI,显著超越DCCAE(84.62%准确率)和VCCAP(83.72%准确率)。
  • 在大规模NUS-WIDE-Object数据集上,DMVCVAE实现了19.09%的准确率、21.29%的NMI和31.68%的纯度,各项指标均优于LSMVSC与BMVC。
  • t-SNE可视化显示,DMVCVAE学习到的潜在空间在训练各阶段均展现出优于DCCAE与VCCAP的聚类分离性与结构清晰度。
  • 消融研究证实,融合权重与共享潜在空间的联合学习显著提升了聚类性能,验证了模型设计的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。