[论文解读] Learning the Stein Discrepancy for Training and Evaluating Energy-Based Models without Sampling
本文提出学习的史特恩差异(LSD),一种无需采样的能量模型训练与评估方法,通过学习神经网络判别器来估计数据分布与模型分布之间的史特恩差异。该方法仅依赖未归一化对数密度的梯度,在高维设置下实现了模型评估与训练可扩展性的最先进性能。
We present a new method for evaluating and training unnormalized density models. Our approach only requires access to the gradient of the unnormalized model's log-density. We estimate the Stein discrepancy between the data density $p(x)$ and the model density $q(x)$ defined by a vector function of the data. We parameterize this function with a neural network and fit its parameters to maximize the discrepancy. This yields a novel goodness-of-fit test which outperforms existing methods on high dimensional data. Furthermore, optimizing $q(x)$ to minimize this discrepancy produces a novel method for training unnormalized models which scales more gracefully than existing methods. The ability to both learn and compare models is a unique feature of the proposed method.
研究动机与目标
- 解决未归一化密度模型(如能量模型,EBM)缺乏可靠、可扩展的评估与训练方法的问题,这些方法通常依赖于昂贵的 MCMC 采样。
- 克服现有基于采样的训练方法的局限性(如有限 MCMC 链导致的梯度偏差)和评估方法的局限性(如依赖近似采样器)。
- 开发一个统一框架,仅通过未归一化对数密度的梯度,实现 EBM 的训练与评估。
- 通过用神经网络估计的史特恩差异替代基于样本的度量,更准确地追踪似然,从而提升模型质量评估。
- 在无需归一化常数或类似得分匹配的代理目标的情况下,实现可扩展的高维 EBM 训练。
提出的方法
- 使用向量值判别函数 $ s(x) $(参数化为神经网络)定义数据分布 $ p(x) $ 与模型 $ q(x) $ 之间的史特恩差异。
- 通过反向传播可微分地训练判别网络,使其最大化史特恩差异,形成一种可扩展的拟合优度检验。
- 将所得差异用作 EBM 的训练目标,通过最小化该差异使模型密度与数据匹配,而无需采样。
- 利用 Huchinson 估计器高效计算史特恩差异中雅可比矩阵的迹,从而实现可扩展的梯度计算。
- 在联合训练方案中交替优化 EBM 和判别器,类似于 GAN,但用于密度建模。
- 确保该方法仅需访问未归一化对数密度的梯度,避免对归一化常数或显式采样的依赖。
实验结果
研究问题
- RQ1能否有效训练一个神经网络,在不依赖采样的前提下,估计高维数据与模型分布之间的史特恩差异?
- RQ2通过神经网络学习判别函数,是否能为未归一化模型提供比现有基于样本的度量更可靠、更可扩展的拟合优度检验?
- RQ3最小化学习到的史特恩差异能否作为能量模型中似然训练的高效、可扩展替代方案?
- RQ4与对比发散或得分匹配等标准目标相比,基于 LSD 的训练目标在追踪实际似然提升方面表现如何?
- RQ5在传统 MCMC 方法无法扩展的高维设置下,LSD 在模型评估与训练方面能多大程度上实现改进?
主要发现
- LSD 在高维拟合优度测试中达到最先进性能,在基准数据集上优于现有方法。
- 基于 LSD 的训练目标比对比发散或得分匹配等标准目标更准确地追踪似然,尤其在高维设置下表现更优。
- 该方法实现了无需采样的可扩展能量模型训练,且性能随维度增加而平稳提升。
- 基于神经网络的判别器在高维中可靠地学习估计史特恩差异,表明深度学习可有效逼近复杂的差异度量。
- LSD 提供了一个统一框架,用于未归一化模型的训练与评估,消除了对独立采样器或启发式度量的需求。
- 在图像数据集上的实验表明,LSD 训练的模型在生成样本质量上具有竞争力,且分布保真度优于使用标准目标训练的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。