[论文解读] A Mixture of Matrix Variate Bilinear Factor Analyzers
该论文提出了一种用于聚类高维矩阵变量子数据的新模型——混合矩阵变量子双线性因子分析模型(MMVBFA),结合了矩阵变量子因子分析与有限混合模型。通过使用AECM算法进行参数估计,该模型在模拟数据和真实数据集(包括MNIST和Olivetti Faces)上均实现了优越的聚类性能,且BIC始终能正确选择最优的分量数与因子数。
Over the years data has become increasingly higher dimensional, which has prompted an increased need for dimension reduction techniques. This is perhaps especially true for clustering (unsupervised classification) as well as semi-supervised and supervised classification. Although dimension reduction in the area of clustering for multivariate data has been quite thoroughly discussed within the literature, there is relatively little work in the area of three-way, or matrix variate, data. Herein, we develop a mixture of matrix variate bilinear factor analyzers (MMVBFA) model for use in clustering high-dimensional matrix variate data. This work can be considered both the first matrix variate bilinear factor analysis model as well as the first MMVBFA model. Parameter estimation is discussed, and the MMVBFA model is illustrated using simulated and real data.
研究动机与目标
- 解决面向三路(矩阵变量子)数据的模型化聚类中缺乏降维技术的问题。
- 开发一种灵活且可扩展的方法,用于处理聚类应用中的高维矩阵数据。
- 通过引入双线性结构与混合模型,将因子分析扩展至矩阵变量子数据。
- 实现矩阵变量子数据的聚类与降维同步进行,优于现有的多变量与矩阵变量子方法。
- 提供一个支持扩展至非正态分布(如t分布和偏态矩阵变量子因子)的框架。
提出的方法
- 提出一种混合矩阵变量子双线性因子分析器(MMVBFA)模型,作为双线性PCA的推广。
- 使用具有双线性因子结构的矩阵变量子正态分布对每个分量进行建模:$\mathbf{X}_{g} = \mathbf{M}_{g} + \mathbf{A}_{g}\mathbf{Z}_{g}\mathbf{B}_{g}^{\top} + \mathbf{E}_{g}$,其中$\mathbf{Z}_{g}$为低维潜因子。
- 采用交替期望条件最大化(AECM)算法进行参数估计。
- 引入各分量特有的均值矩阵$\mathbf{M}_{g}$、行与列因子载荷矩阵$\mathbf{A}_{g}, \mathbf{B}_{g}$,以及分量混合比例$\pi_{g}$。
- 应用贝叶斯信息准则(BIC)以选择最优的分量数与潜因子数。
- 利用矩阵变量子正态假设,为未来扩展至矩阵变量子t分布、偏椭球分布及广义双曲因子分析器提供支持。
实验结果
研究问题
- RQ1双线性因子模型能否被有效扩展至矩阵变量子数据,以实现聚类目的?
- RQ2与现有方法相比,MMVBFA模型在聚类高维矩阵变量子数据方面表现如何?
- RQ3该模型能否通过BIC自动选择最优的分量数与潜因子数?
- RQ4半监督学习在真实世界图像数据上的聚类性能提升程度如何?
- RQ5该模型能否在矩阵变量子数据中检测出有意义的子群,例如眼镜等面部特征?
主要发现
- 在所有模拟数据集中,MMVBFA模型实现了完美分类,且BIC正确选出了真实的分量数与因子数。
- 在MNIST数据集上,模型在75%监督水平下平均Rand指数(ARI)达到0.93,误分类率(MCR)为0.018,优于Gallaugher和McNicholas(2018a)的先前工作。
- 对于MNIST数据,BIC选择的行因子与列因子数量在所有监督水平下最常位于13至15之间。
- 在Olivetti Faces数据集中,BIC选择了三个分量,分别具有26个行因子与23个列因子,且分量3明显与戴眼镜相关。
- 所有戴眼镜的面部图像均被归入分量3,仅有两个被分入分量2,表明该模型具备检测有意义面部特征的能力。
- 估计位置矩阵的热图显示,随着监督程度提高,图像质量得到改善;且在25次运行中模型性能保持一致,表现出良好鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。