Skip to main content
QUICK REVIEW

[论文解读] A Test of Relative Similarity For Model Selection in Generative Models

Wacha Bounliphone, Eugene Belilovsky|arXiv (Cornell University)|Nov 14, 2015
Generative Adversarial Networks and Image Synthesis参考文献 22被引用 12
一句话总结

该论文提出了一种非参数统计假设检验方法——相对MMD(Relative MMD),通过评估哪个生成模型产生的样本显著更接近真实参考数据集,来比较生成模型。该方法基于每个模型生成样本与参考数据集之间最大均值差异(MMD)值的差异,推导出联合渐近分布以进行显著性检验,从而在似然函数难以计算时实现可靠的模型选择。该方法在深度生成模型中被证明与似然函数、准确率及变分下界一致。

ABSTRACT

Probabilistic generative models provide a powerful framework for representing data that avoids the expense of manual annotation typically needed by discriminative approaches. Model selection in this generative setting can be challenging, however, particularly when likelihoods are not easily accessible. To address this issue, we introduce a statistical test of relative similarity, which is used to determine which of two models generates samples that are significantly closer to a real-world reference dataset of interest. We use as our test statistic the difference in maximum mean discrepancies (MMDs) between the reference dataset and each model dataset, and derive a powerful, low-variance test based on the joint asymptotic distribution of the MMDs between each reference-model pair. In experiments on deep generative models, including the variational auto-encoder and generative moment matching network, the tests provide a meaningful ranking of model performance as a function of parameter and training settings.

研究动机与目标

  • 解决在似然函数难以计算或计算成本过高的情况下,深度生成模型中模型选择的挑战。
  • 开发一种统计上严谨、方差较低的方法,基于两个生成模型相对于真实参考数据集的相对相似性,对它们进行比较。
  • 提供一种假设检验方法,判断一个模型的样本是否显著比另一个模型更接近参考数据集,而无需依赖似然函数或昂贵的交叉验证。
  • 将最大均值差异(MMD)的用途从训练阶段扩展到模型评估与选择,并赋予其统计显著性。

提出的方法

  • 该检验使用每个模型生成样本与真实参考数据集之间MMD值的差异作为检验统计量。
  • 在两个模型分布不相等的假设下,推导出两个相关MMD(分别来自两个模型到同一参考数据集)的联合渐近分布,从而实现显著性检验。
  • 原假设为第二个模型并不显著比第一个模型更接近参考数据集;备择假设为第一个模型更接近参考数据集。
  • 该方法为非参数方法,基于U-统计量,可推广至多个相关统计量,并具备稳健的渐近行为。
  • 使用特征核确保MMD在概率分布上构成合适的度量,从而实现每个分布的唯一嵌入。
  • 该方法在VAE和GMMN的各种训练策略与超参数设置下应用,用于对模型性能进行排序。

实验结果

研究问题

  • RQ1能否开发一种统计检验方法,判断在似然函数难以计算时,一个生成模型是否产生的样本显著比另一个更接近真实数据分布?
  • RQ2在两个模型分布不相等的前提下,如何推导出两个MMD(分别来自不同模型到同一参考数据集)的联合渐近分布?
  • RQ3相对MMD检验是否能产生与似然函数、分类准确率及变分下界等现有指标一致的模型性能排序?
  • RQ4该检验是否能可靠检测在不同模型架构与训练设置下性能的差异,而无需计算似然函数?

主要发现

  • 在合成实验中,无论原假设还是备择假设下,相对MMD检验均能正确识别出样本质量更优的模型。
  • 在MNIST数据集上,参数更少的GMMN层数和更多隐藏节点的模型被检验显著偏好,该结果与更高的似然值和更好的分类准确率一致。
  • 该检验与Parzen窗似然估计值及变分下界高度一致,验证了其作为评估指标的可靠性。
  • 该方法在无需昂贵的交叉验证或置换检验的情况下,提供了统计显著性保证。
  • 该检验计算效率高(时间复杂度为二次方),具有收敛性,其理论基础建立在分布间矩匹配比较的收敛性之上。
  • 结果表明,MMD不仅可用于训练,还可用于深度生成模型中基于原则与显著性的模型选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。