[论文解读] Understanding Variational Inference in Function-Space
本文揭示了在函数空间中使用Kullback-Leibler(KL)散度进行变分推断时存在的根本性问题,表明当使用非退化的高斯过程先验和参数化变分族时,目标函数可能未正确定义。本文提出以贝叶斯线性回归作为原则性基准,独立于预测性能评估函数型变分推断方法的近似质量,从而实现对近似质量的准确评估。
Recent work has attempted to directly approximate the `function-space' or predictive posterior distribution of Bayesian models, without approximating the posterior distribution over the parameters. This is appealing in e.g. Bayesian neural networks, where we only need the former, and the latter is hard to represent. In this work, we highlight some advantages and limitations of employing the Kullback-Leibler divergence in this setting. For example, we show that minimizing the KL divergence between a wide class of parametric distributions and the posterior induced by a (non-degenerate) Gaussian process prior leads to an ill-defined objective function. Then, we propose (featurized) Bayesian linear regression as a benchmark for `function-space' inference methods that directly measures approximation quality. We apply this methodology to assess aspects of the objective function and inference scheme considered in Sun, Zhang, Shi, and Grosse (2018), emphasizing the quality of approximation to Bayesian inference as opposed to predictive performance.
研究动机与目标
- 调查在函数空间变分推断中使用KL散度目标函数的有效性与良定义性。
- 识别当使用非退化的高斯过程先验和参数化变分族时,KL散度目标函数变得未正确定义的条件。
- 提出一种基准,用于评估函数型变分推断方法,将近似质量与预测性能分离。
- 通过将推断准确性与预测性能解耦,评估现有方法(如Sun等,2018年)中近似的影响。
- 为未来函数型变分推断方法的改进提供原则性基础。
提出的方法
- 作者分析了在函数空间中,非退化高斯过程先验与参数化变分族之间的KL散度,证明当变分族无法覆盖后验分布的支撑集时,目标函数可能未正确定义。
- 他们将分析扩展到具有ReLU激活函数的单隐藏层贝叶斯神经网络,表明当先验与后验宽度不同时,目标函数可能未正确定义。
- 他们提出以贝叶斯线性回归(BLR)作为基准,因其具有闭式精确后验分布,且在函数空间中的KL散度可计算。
- 该基准可通过将变分后验与真实后验直接比较,独立于预测性能,实现对近似质量的直接评估。
- 他们将该基准应用于分析Sun等(2018年)的方法,隔离了目标函数近似对推断质量的影响。
- 该方法使用一组诱导点来定义特征映射,并通过基于梯度的方法(如Adam、L-BFGS)优化变分参数,同时通过加入微小扰动(jitter)仔细处理数值稳定性问题。
实验结果
研究问题
- RQ1当使用非退化的高斯过程先验和参数化变分族时,在函数空间变分推断中,KL散度目标函数在何种条件下未正确定义?
- RQ2为何在这些设置下,KL散度目标函数无法提供合理的优化目标?
- RQ3能否构建一个基准,用于独立于预测性能评估函数型变分推断的近似质量?
- RQ4如Sun等(2018年)方法中那样,目标函数的近似如何影响后验分布推断的准确性?
- RQ5贝叶斯线性回归在多大程度上可作为评估函数型变分推断方法的可靠基准?
主要发现
- 当变分族无法覆盖真实后验的支撑集时,函数空间变分推断中的KL散度目标函数未正确定义,尤其在先验为非退化高斯过程且变分族为参数化时更为明显。
- 这种未正确定义源于KL散度中的Radon-Nikodym导数在变分测度相对于后验测度不绝对连续时未定义。
- 在具有ReLU激活函数的单隐藏层贝叶斯神经网络中,当先验与后验宽度不同时,该问题依然存在,导致KL散度不可 summable(不可求和)。
- 贝叶斯线性回归为函数型变分推断提供了有效基准,因为其精确后验和函数空间中的KL散度均可闭式计算。
- 通过该基准,作者表明即使变分后验对后验的近似质量较差,预测性能仍可能保持较高,凸显了需单独评估推断质量的必要性。
- 该研究揭示,如Sun等(2018年)方法中对目标函数的近似,即使预测性能得以保持,仍可能显著降低后验近似的质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。