Skip to main content
QUICK REVIEW

[论文解读] Variational Predictive Information Bottleneck

Alexander A. Alemi|arXiv (Cornell University)|Oct 23, 2019
Gaussian Processes and Bayesian Inference参考文献 19被引用 10
一句话总结

本文提出了一种变分预测信息瓶颈框架,将现代推理方法——如贝叶斯推理、最大似然和变分推理——统一于单一的信息论目标之下。通过推导预测信息瓶颈的变分下界,表明广义贝叶斯推理(包括温度正则化和经验贝叶斯方法)自然地成为其特例,为学习提供了基于表示的、具有改进泛化界的原则性视角。

ABSTRACT

In classic papers, Zellner demonstrated that Bayesian inference could be derived as the solution to an information theoretic functional. Below we derive a generalized form of this functional as a variational lower bound of a predictive information bottleneck objective. This generalized functional encompasses most modern inference procedures and suggests novel ones.

研究动机与目标

  • 将多种推理方法统一于一个基于预测信息的单一信息论目标之下。
  • 推导预测信息瓶颈的变分下界,以推广现有的推理过程。
  • 证明标准方法(如贝叶斯推理、最大似然和变分推理)是广义推理框架的特例。
  • 提供一种以表示为先的学习视角,通过最小化在给定未来数据后的残余信息,改善泛化性能。
  • 通过放松常见的变分近似(如因子化似然和无条件先验),激发新的推理方法。

提出的方法

  • 通过引入拉格朗日乘子 β 来平衡预测信息与表示信息,推导出一个无约束的变分目标。
  • 提出对残余信息 I(θ; xP|x_F) 的变分上界,使用与未来数据无关的变分先验 q(θ)。
  • 通过将似然近似为因子化乘积 ∏i q(xi|θ) 对 I(θ; xP) 应用变分下界,使目标可计算。
  • 将两个边界结合为单一目标:E[log p(θ|xP)/q(θ) - β ∑i log q(xi|θ)],该目标作为预测信息瓶颈的下界。
  • 表明 β 的不同取值可恢复已知的推理范式:β→0(先验预测),β=1(贝叶斯),β→∞(最大似然)。
  • 将框架扩展至包含数据增强和参数族,表明在增强数据上的广义贝叶斯推理仍为有效下界。

实验结果

研究问题

  • RQ1如何通过统一的信息论目标,将贝叶斯推理、最大似然和变分推理等多样化的推理过程统一起来?
  • RQ2拉格朗日乘子 β 在控制预测能力与表示复杂性之间的权衡中起什么作用?
  • RQ3对后验和未来数据分布的变分近似如何影响信息瓶颈边界的紧致性?
  • RQ4广义贝叶斯推理和数据增强能否自然地嵌入此框架中,作为有效下界?
  • RQ5若将无条件变分先验 q(θ) 替换为基于其他数据集的更优先验 q(θ|x_F),其影响是什么?

主要发现

  • 所提出的变分下界推广了 Zellner 的贝叶斯推理,且在 β=1 和 β→0 时分别包含最大似然和先验预测推理作为极限情况。
  • 当似然因子化且先验固定时,该框架恢复标准变分推理,并可在参数族下扩展至吉布斯变分推理。
  • 当在固定表示和 β=1 下优化先验或似然时,经验贝叶斯和神经过程方法被证明是其特例。
  • 在似然属于指数族时,加入零均值噪声的数据增强可保持变分边界不变,从而在数据扰动下实现鲁棒推理。
  • 通过用基于其他数据集的条件近似 q(θ|x_F) 替代无条件先验 q(θ),可获得更紧的边界,从而提升泛化性能。
  • 以表示为先的视角揭示,常见的变分近似(如因子化似然和固定先验)是次优的,可通过放松以提升推理质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。