[论文解读] Spike and Slab Gaussian Process Latent Variable Models
本文提出了一种尖峰与泥浆高斯过程潜在变量模型(SS-GP-LVM),通过二值切换变量实现对活跃潜在维度的概率选择,从而实现有原则的、自动的维度选择。通过推导变分下界并高效地推断潜在变量与开关变量,该方法在跨模态检索任务中表现优于现有最先进模型,在文本查询上达到0.540 mAP的性能,显著优于先前方法,且在训练过程中保持无监督。
The Gaussian process latent variable model (GP-LVM) is a popular approach to non-linear probabilistic dimensionality reduction. One design choice for the model is the number of latent variables. We present a spike and slab prior for the GP-LVM and propose an efficient variational inference procedure that gives a lower bound of the log marginal likelihood. The new model provides a more principled approach for selecting latent dimensions than the standard way of thresholding the length-scale parameters. The effectiveness of our approach is demonstrated through experiments on real and simulated data. Further, we extend multi-view Gaussian processes that rely on sharing latent dimensions (known as manifold relevance determination) with spike and slab priors. This allows a more principled approach for selecting a subset of the latent space for each view of data. The extended model outperforms the previous state-of-the-art when applied to a cross-modal multimedia retrieval task.
研究动机与目标
- 为解决GP-LVM中通过启发式阈值法选择潜在维度的局限性,该方法通常需要手动调参且缺乏理论基础。
- 提出一种基于尖峰与泥浆先验的有原则贝叶斯方法,用于潜在维度选择,允许对维度进行概率性的开启/关闭切换。
- 通过流形相关性确定(MRD)将方法扩展至多视角学习,实现共享与私有潜在空间,并对每类视角实现自动维度选择。
- 在训练过程中不使用标签信息的前提下,实现跨模态检索任务中的卓越性能。
提出的方法
- 在潜在变量上引入尖峰与泥浆先验,其中二值开关变量决定每个潜在维度是否处于激活或非激活状态。
- 推导出对数边际似然的闭式变分下界,以实现对潜在变量与开关变量的高效推断。
- 采用结构化变分推断方法,对潜在变量与开关变量之间的条件依赖关系进行建模,避免标准均场近似带来的问题。
- 通过流形相关性确定将该方法应用于多视角GP-LVM,实现共享与视角特异性潜在空间,并支持自动维度选择。
- 采用GPU加速的并行推断,实现对真实世界数据集的可扩展训练。
- 使用平方指数核函数,并在推断前将特征标准化为零均值与单位方差。
实验结果
研究问题
- RQ1尖峰与泥浆先验能否有效应用于GP-LVM,以实现对潜在维度数量的自动、有原则的选择?
- RQ2与标准长度尺度阈值法相比,所提出的变分推断方法在模型选择准确性和鲁棒性方面表现如何?
- RQ3尖峰与泥浆方法能否扩展至结合流形相关性确定的多视角GP-LVM,以提升跨模态学习性能?
- RQ4该方法是否在不使用训练阶段标签信息的情况下,实现了跨模态检索的最先进性能?
主要发现
- 所提出的SSMRD模型在Wikipedia跨模态检索数据集的文本查询上实现了0.540的平均精确率(mAP),显著优于先前最先进方法(SCM: 0.273 mAP)。
- 该模型在文本查询上的精确率-召回率曲线下降速度慢于所有对比方法,表明其排序质量更优。
- 对于图像查询,该模型实现了0.170 mAP的性能,低于最先进水平,可能由于诱导输入数量不足(仅使用100个)且训练期间缺乏标签信息。
- 该方法通过概率开关机制实现潜在维度的自动、有原则的选择,消除了对长度尺度参数手动阈值化的依赖。
- 变分推断框架成功处理了开关变量与潜在输入之间的强相关性,避免了标准均场近似中常见的问题。
- 尽管在训练过程中未使用标签信息,该模型在跨模态检索任务中仍优于所有对比方法,证明了其鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。