Skip to main content
QUICK REVIEW

[论文解读] Bayesian Inference with Anchored Ensembles of Neural Networks, and Application to Exploration in Reinforcement Learning

Tim Pearce, Nicolas Anastassacos|arXiv (Cornell University)|May 29, 2018
Adversarial Robustness in Machine Learning参考文献 13被引用 20
一句话总结

本文提出锚定集成方法——一种神经网络集成方法,其中各网络参数被正则化至其初始权重而非零值,从而实现解析贝叶斯推断。该方法在无限宽度与无限集成规模的极限下收敛至高斯过程,并通过汤普森采样实现稳定、基于不确定性的强化学习探索,其学习稳定性和策略质量优于ε-贪婪策略。

ABSTRACT

The use of ensembles of neural networks (NNs) for the quantification of predictive uncertainty is widespread. However, the current justification is intuitive rather than analytical. This work proposes one minor modification to the normal ensembling methodology, which we prove allows the ensemble to perform Bayesian inference, hence converging to the corresponding Gaussian Process as both the total number of NNs, and the size of each, tend to infinity. This working paper provides early-stage results in a reinforcement learning setting, analysing the practicality of the technique for an ensemble of small, finite number. Using the uncertainty estimates produced by anchored ensembles to govern the exploration-exploitation process results in steadier, more stable learning.

研究动机与目标

  • 为神经网络集成在不确定性量化中的应用提供解析性依据。
  • 解决训练过程中集成成员发生坍缩的问题,即所有模型收敛至相同预测结果。
  • 在无需完整后验计算的前提下,实现神经网络中实用的贝叶斯推断。
  • 利用锚定集成提供的不确定性估计,改进强化学习中的探索策略。
  • 提供一种可扩展、低成本的贝叶斯神经网络与蒙特卡洛方法的替代方案。

提出的方法

  • 将每个神经网络参数正则化至其初始值而非零,以保留先验信息。
  • 通过将每个模型锚定至其初始化状态,保持集成多样性,防止收敛至相同解。
  • 在参数上施加多变量高斯先验,并采用最大后验估计(MAP)以实现解析贝叶斯推断。
  • 证明当网络宽度与集成规模均趋于无穷大时,锚定集成收敛至对应的高斯过程。
  • 利用锚定集成的不确定性估计指导强化学习中的汤普森采样。
  • 将集成预测的方差用作预测不确定性的度量,以指导探索。

实验结果

研究问题

  • RQ1将神经网络参数锚定至其初始值是否能实现在集成中的解析贝叶斯推断?
  • RQ2锚定是否能保持模型多样性,并防止训练过程中的集成坍缩?
  • RQ3锚定集成在强化学习中的性能与标准集成及其他贝叶斯近似方法相比如何?
  • RQ4锚定集成提供的不确定性估计是否能带来更稳定、更有效的强化学习探索?
  • RQ5锚定集成收敛至其对应高斯过程极限的速度如何?

主要发现

  • 在无限宽度与无限集成规模的极限下,锚定集成收敛至对应的高斯过程,为贝叶斯推断提供了理论基础。
  • 该方法在多变量高斯先验假设下实现了解析贝叶斯推断,相关形式化证明见补充材料。
  • 在强化学习中,使用锚定集成不确定性进行汤普森采样的方法,呈现出更稳定、呈指数衰减的学习曲线,而ε-贪婪策略则呈现S型曲线。
  • 该方法通过在罕见或非关键状态维持高不确定性(从而促进探索),在关键状态进行利用,从而实现更安全的探索。
  • 该方法在学习稳定性方面优于ε-贪婪策略,且在第800轮左右未观察到性能突然下降。
  • 在无噪声CartPole环境中,锚定集成方法未显著优于标准集成,表明其优势可能在更复杂或更嘈杂的环境中显现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。