[论文解读] Machine Learning using the Variational Predictive Information Bottleneck with a Validation Set
本文将预测性信息瓶颈框架扩展至机器学习训练中包含验证集的情形,通过将模型训练形式化为信息处理优化问题,平衡未来数据的预测能力、训练数据的压缩性以及验证集性能。主要贡献在于提出了一种变分推断目标,通过联合信息瓶颈准则整合训练、验证和未来数据,当优化成功时,可导出类似贝叶斯的更新规则。
Zellner (1988) modeled statistical inference in terms of information processing and postulated the Information Conservation Principle (ICP) between the input and output of the information processing block, showing that this yielded Bayesian inference as the optimum information processing rule. Recently, Alemi (2019) reviewed Zellner's work in the context of machine learning and showed that the ICP could be seen as a special case of a more general optimum information processing criterion, namely the Predictive Information Bottleneck Objective. However, Alemi modeled the model training step in machine learning as using training and test data sets only, and did not account for the use of a validation data set during training. The present note is an attempt to extend Alemi's information processing formulation of machine learning, and the predictive information bottleneck objective for model training, to the widely-used scenario where training utilizes not only a training but also a validation data set.
研究动机与目标
- 将预测性信息瓶颈框架扩展至包含机器学习训练中的验证集,尽管验证集在实践中被广泛使用,但此前的信息论公式中却缺失这一部分。
- 将模型训练形式化为信息处理任务,通过最大化模型参数与未来数据之间的互信息,同时对来自训练和验证数据的信息施加约束。
- 推导出一种变分近似,使得涉及过去、验证和未来数据的联合信息瓶颈目标可进行可计算的优化。
- 证明当新目标函数成功优化时,可导出一种包含训练、验证和未来数据的贝叶斯更新规则。
提出的方法
- 提出一种联合信息瓶颈目标,通过拉格朗日乘子法,最大化模型参数与未来数据之间的互信息,同时对训练和验证数据的信息进行约束。
- 利用马尔可夫性质与信息论恒等式,推导出等价的无约束优化问题,从而转化为对条件互信息加权和的最小化。
- 应用两种变分近似:一种用于模型参数的后验分布,另一种用于训练和验证数据的似然函数,从而实现可计算的优化。
- 引入一种用于模型参数的变分分布,将先验、训练似然和验证似然结合,其中包含类似温度的超参数 β 和 γ。
- 推导出最优变分后验为先验、训练似然的 β 次幂和验证似然的 γ 次幂的归一化乘积,其中包含一个配分函数 Zβ,γ。
- 证明当训练和验证数据的信息约束被满足时(即 I(θ; xP) > I′0 且 I(θ; xV|xP) > I′′0),最优更新规则退化为包含训练和验证数据联合似然的贝叶斯推断。
实验结果
研究问题
- RQ1如何将预测性信息瓶颈框架扩展至包含机器学习训练中的验证集?
- RQ2在平衡未来数据预测性能与训练和验证数据压缩性之间,其信息论目标是什么?
- RQ3包含验证集如何影响模型后验的变分近似与优化?
- RQ4在何种条件下,所提出的优化目标会退化为贝叶斯推断?
- RQ5超参数 β 和 γ 在控制训练、验证和未来数据信息量之间的权衡中起什么作用?
主要发现
- 所提出的优化目标函数被一个依赖于真实数据分布和模型参数变分后验的变分目标所上界控制。
- 最优变分后验被推导为先验、训练似然的 β 次幂和验证似然的 γ 次幂的归一化乘积,其中包含配分函数 Zβ,γ。
- 当训练和验证数据的信息约束被满足时(即 I(θ; xP) > I′0 且 I(θ; xV|xP) > I′′0),最优更新规则退化为使用训练和验证数据联合似然的贝叶斯推断。
- 该方法为在模型训练中使用验证集提供了严谨的信息论基础,表明这种实践自然源于信息处理的视角。
- 该框架将 Alemi 的预测性信息瓶颈推广至包含验证数据,从互信息的角度统一了训练、验证和泛化过程。
- 在优化成功时,该方法与贝叶斯推断保持一致,表明基于验证集的超参数调优与最优信息处理过程相一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。