[论文解读] Bayesian Inference with Anchored Ensembles of Neural Networks, and Application to Reinforcement Learning.
本文提出通过固定神经网络集成来实现贝叶斯推断,证明了当集成数量和网络规模趋于无穷时,其收敛于高斯过程。在强化学习中,该方法利用小规模集成即可实现稳定且基于不确定性的探索,显著提升了学习稳定性。
The use of ensembles of neural networks (NNs) for the quantification of predictive uncertainty is widespread. However, the current justification is intuitive rather than analytical. This work proposes one minor modification to the normal ensembling methodology, which we prove allows the ensemble to perform Bayesian inference, hence converging to the corresponding Gaussian Process as both the total number of NNs, and the size of each, tend to infinity. This working paper provides early-stage results in a reinforcement learning setting, analysing the practicality of the technique for an ensemble of small, finite number. Using the uncertainty estimates they produce to govern the exploration-exploitation process results in steadier, more stable learning.
研究动机与目标
- 为神经网络集成在不确定性量化中的应用提供分析基础,超越直观的解释。
- 开发一种改进的集成方法,通过固定机制实现有效的贝叶斯推断。
- 评估固定集成在有限、小规模模型下的强化学习实际性能。
- 评估固定集成的不确定性估计是否能稳定强化学习中的探索-利用权衡。
- 证明在无限宽度和无限集成规模极限下,其收敛于高斯过程。
提出的方法
- 提出一种新颖的固定机制,通过在集成中所有网络间固定部分权重,确保功能行为的一致性。
- 通过共享通用主干网络或初始化方式,修改标准集成训练流程,实现对集成成员的有效固定。
- 从理论上证明,当网络数量和宽度均趋于无穷时,固定集成收敛于高斯过程。
- 利用固定集成的预测不确定性来指导强化学习智能体的探索。
- 训练具有共享结构的小型有限集成,以估计认知不确定性。
- 将不确定性估计作为探索奖励应用于强化学习算法,以改善学习动态。
实验结果
研究问题
- RQ1在无限极限下,固定神经网络集成是否能实现有效的贝叶斯推断?
- RQ2与标准集成相比,固定集成在不确定性校准方面表现如何?
- RQ3在小规模、有限大小的固定集成下,是否能提升强化学习中的探索稳定性?
- RQ4固定集成的不确定性是否能带来更一致和可靠的训练轨迹?
- RQ5固定集成与高斯过程之间存在何种理论关系?
主要发现
- 在网络宽度和集成规模趋于无穷的极限下,固定集成可被严格证明收敛于高斯过程。
- 固定机制为集成不确定性提供了理论依据,超越了启发式推理。
- 在强化学习中,固定集成的不确定性估计可带来更稳定且一致的学习曲线。
- 即使使用小规模有限集成,该方法仍能生成有意义的不确定性估计,并有效引导探索。
- 该方法在真实强化学习场景中展现出实际可行性,其学习稳定性优于标准集成方法。
- 结果表明,固定集成在深度学习与贝叶斯非参数方法之间架起了一座桥梁。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。