[论文解读] Gaussian mixture models with Wasserstein distance
本文提出高斯混合 Wasserstein 自编码器(GM-WAEs),利用 Wasserstein 距离的最优传输方法训练同时包含离散与连续潜在变量的生成模型。该方法在不修改目标函数或超参数的情况下成功训练 MNIST 数据集,实现了高达 76% 准确率的离散潜在变量保真度,并能生成有意义的样本。
Generative models with both discrete and continuous latent variables are highly motivated by the structure of many real-world data sets. They present, however, subtleties in training often manifesting in the discrete latent being under leveraged. In this paper, we show that such models are more amenable to training when using the Optimal Transport framework of Wasserstein Autoencoders. We find our discrete latent variable to be fully leveraged by the model when trained, without any modifications to the objective function or significant fine tuning. Our model generates comparable samples to other approaches while using relatively simple neural networks, since the discrete latent variable carries much of the descriptive burden. Furthermore, the discrete latent provides significant control over generation.
研究动机与目标
- 解决在标准 VAE 中离散潜在变量利用不足的问题,训练同时包含离散与连续潜在变量的生成模型。
- 克服变分自编码器(VAEs)在训练高斯混合潜在变量模型(GM-LVMs)时的不稳定性与收敛性差的问题,特别是在无监督设置下。
- 证明最优传输框架——特别是 Wasserstein 自编码器(WAE)目标函数——相比传统 VAE 能更有效地训练 GM-LVMs。
- 展示离散潜在变量在无需架构或目标函数修改的情况下被完全利用,从而实现对生成过程的更好控制,并提升重建保真度。
提出的方法
- 构建一个分层生成模型,其中数据分布被建模为连续潜在变量上的高斯混合,而一个离散的类别潜在变量控制混合成分。
- 采用 Wasserstein 自编码器(WAE)框架,最小化真实数据分布与模型生成分布之间的最优传输(Wasserstein)距离。
- 使用变分后验 $ q_{D}(k|x) $ 和 $ q_{C}(z|k,x) $ 进行训练,目标函数基于 WAE 的分布匹配损失。
- 利用 Wasserstein 距离带来的较弱拓扑结构,稳定训练过程,并促进变分后验与先验之间的更好对齐。
- 应用 UMAP 降维方法可视化连续潜在空间,评估聚类结构及与先验的对齐程度。
- 通过简单的标签分配协议评估离散潜在变量保真度:将每个离散潜在变量 $ k $ 分配给后验概率平均最高的数字类别,然后在测试集上计算分类准确率。
实验结果
研究问题
- RQ1Wasserstein 自编码器框架能否在无监督设置下有效训练高斯混合潜在变量模型(GM-LVMs),而传统 VAE 通常在此类设置下失败?
- RQ2与 VAE 目标函数相比,使用最优传输是否能提升 GM-LVMs 中离散潜在变量的利用率?
- RQ3在无监督或无需目标函数修改的情况下,GM-WAE 中的离散潜在变量在多大程度上学习到有意义且与类别相关的表征?
- RQ4与标准 VAE 或 GAN 相比,GM-WAE 模型中的连续与离散潜在变量在数据重建和生成真实样本方面表现如何?
主要发现
- GM-WAE 模型在无监督设置下成功训练 MNIST 数据集,无需修改目标函数,也无需显著调整超参数。
- 模型充分利用了离散潜在变量,在测试集上实现 76% 的数字类别分配准确率,显著优于基础 K-means 聚类(50–60%)。
- 模型能从先验分布生成高质量、逼真的样本,表明潜在空间中实现了有效的解耦与有意义的结构。
- 使用 UMAP 的可视化显示,连续潜在变量 $ z $ 形成清晰且重叠的聚类,对应于不同数字类别,且变分后验与先验之间具有强对齐。
- 离散变分分布 $ q_{D}(k|x) $ 学会将不同数字类别分配给不同的离散潜在组件,尽管存在部分重叠(如 9 被分配给 $ k=0,4,9 $),反映了手写数字的自然变化。
- 模型保持了变分后验与先验之间的紧密接近,表明通过 WAE 目标函数实现了有效的分布匹配与稳定训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。