QUICK REVIEW
[论文解读] Variational Predictive Information Bottleneck
Alexander A. Alemi|arXiv (Cornell University)|Oct 23, 2019
Gaussian Processes and Bayesian Inference参考文献 19被引用 10
一句话总结
本文提出了一种变分预测信息瓶颈框架,将现代推理方法——如贝叶斯推理、最大似然和变分推理——统一于单一的信息论目标之下。通过推导预测信息瓶颈的变分下界,表明广义贝叶斯推理(包括温度正则化和经验贝叶斯方法)自然地成为其特例,为学习提供了基于表示的、具有改进泛化界的原则性视角。
ABSTRACT
In classic papers, Zellner demonstrated that Bayesian inference could be derived as the solution to an information theoretic functional. Below we derive a generalized form of this functional as a variational lower bound of a predictive information bottleneck objective. This generalized functional encompasses most modern inference procedures and suggests novel ones.
研究动机与目标
- 将多种推理方法统一于一个基于预测信息的单一信息论目标之下。
- 推导预测信息瓶颈的变分下界,以推广现有的推理过程。
- 证明标准方法(如贝叶斯推理、最大似然和变分推理)是广义推理框架的特例。
- 提供一种以表示为先的学习视角,通过最小化在给定未来数据后的残余信息,改善泛化性能。
- 通过放松常见的变分近似(如因子化似然和无条件先验),激发新的推理方法。
提出的方法
- 通过引入拉格朗日乘子 β 来平衡预测信息与表示信息,推导出一个无约束的变分目标。
- 提出对残余信息 I(θ; xP|x_F) 的变分上界,使用与未来数据无关的变分先验 q(θ)。
- 通过将似然近似为因子化乘积 ∏i q(xi|θ) 对 I(θ; xP) 应用变分下界,使目标可计算。
- 将两个边界结合为单一目标:E[log p(θ|xP)/q(θ) - β ∑i log q(xi|θ)],该目标作为预测信息瓶颈的下界。
- 表明 β 的不同取值可恢复已知的推理范式:β→0(先验预测),β=1(贝叶斯),β→∞(最大似然)。
- 将框架扩展至包含数据增强和参数族,表明在增强数据上的广义贝叶斯推理仍为有效下界。
实验结果
研究问题
- RQ1如何通过统一的信息论目标,将贝叶斯推理、最大似然和变分推理等多样化的推理过程统一起来?
- RQ2拉格朗日乘子 β 在控制预测能力与表示复杂性之间的权衡中起什么作用?
- RQ3对后验和未来数据分布的变分近似如何影响信息瓶颈边界的紧致性?
- RQ4广义贝叶斯推理和数据增强能否自然地嵌入此框架中,作为有效下界?
- RQ5若将无条件变分先验 q(θ) 替换为基于其他数据集的更优先验 q(θ|x_F),其影响是什么?
主要发现
- 所提出的变分下界推广了 Zellner 的贝叶斯推理,且在 β=1 和 β→0 时分别包含最大似然和先验预测推理作为极限情况。
- 当似然因子化且先验固定时,该框架恢复标准变分推理,并可在参数族下扩展至吉布斯变分推理。
- 当在固定表示和 β=1 下优化先验或似然时,经验贝叶斯和神经过程方法被证明是其特例。
- 在似然属于指数族时,加入零均值噪声的数据增强可保持变分边界不变,从而在数据扰动下实现鲁棒推理。
- 通过用基于其他数据集的条件近似 q(θ|x_F) 替代无条件先验 q(θ),可获得更紧的边界,从而提升泛化性能。
- 以表示为先的视角揭示,常见的变分近似(如因子化似然和固定先验)是次优的,可通过放松以提升推理质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。