[论文解读] Provable Model-based Nonlinear Bandit and Reinforcement Learning: Shelve Optimism, Embrace Virtual Curvature
该论文提出ViOlin,一种基于模型的非线性Bandit与强化学习算法,通过使用虚拟曲率而非乐观性(optimism)来保证收敛至近似局部最大值。该方法建立了仅依赖于模型类的序列Rademacher复杂度的样本复杂度界,表明即使对于具有确定性奖励的一层神经网络,全局收敛在统计上也是不可行的。
This paper studies model-based bandit and reinforcement learning (RL) with nonlinear function approximations. We propose to study convergence to approximate local maxima because we show that global convergence is statistically intractable even for one-layer neural net bandit with a deterministic reward. For both nonlinear bandit and RL, the paper presents a model-based algorithm, Virtual Ascent with Online Model Learner (ViOlin), which provably converges to a local maximum with sample complexity that only depends on the sequential Rademacher complexity of the model class. Our results imply novel global or local regret bounds on several concrete settings such as linear bandit with finite or sparse model class, and two-layer neural net bandit. A key algorithmic insight is that optimism may lead to over-exploration even for two-layer neural net model class. On the other hand, for convergence to local maxima, it suffices to maximize the virtual return if the model can also reasonably predict the size of the gradient and Hessian of the real return.
研究动机与目标
- 解决使用神经网络函数逼近时,非线性Bandit与强化学习中全局收敛的统计不可行性问题。
- 鉴于全局优化对单层神经网络Bandit而言在理论上不可行,将目标从全局收敛重新定义为近似局部最大值的收敛。
- 设计一种基于模型的算法,其样本复杂度关于模型类的序列Rademacher复杂度呈多项式依赖。
- 证明在非线性设置中,乐观性探索会导致过度探索,而虚拟曲率可实现高效收敛。
- 为具体场景(包括有限/稀疏模型的线性Bandit和两层神经网络Bandit)提供可证明的遗憾界。
提出的方法
- 提出ViOlin(虚拟上升与在线模型学习器),一种基于模型的算法,其通过模型预测的梯度与Hessian矩阵来最大化虚拟回报。
- 使用序列Rademacher复杂度来衡量奖励与动态模型类的复杂度,作为样本复杂度界的理论基础。
- 用基于曲率的更新替代基于乐观性的探索,利用对真实回报函数梯度与Hessian矩阵的模型预测。
- 采用模拟引理(simulation lemma)来关联真实动态与模型动态之间的价值差异,实现误差传播的控制。
- 引入策略梯度引理,将梯度更新与确定性动态下价值函数的改进相联系。
- 使用高斯平滑与伸缩技术,对涉及模型参数与真实参数的双线性形式差异进行有界控制。
实验结果
研究问题
- RQ1在一维神经网络奖励的非线性Bandit问题中,全局收敛在统计上是否可行?
- RQ2当全局收敛不可行时,基于模型的强化学习算法能否实现对局部最大值的样本高效收敛?
- RQ3在非线性函数逼近设置中,基于乐观性的探索是否会导致过度探索?
- RQ4基于预测梯度与Hessian矩阵的虚拟曲率能否替代乐观性以实现高效探索?
- RQ5基于模型类复杂度,基于模型的非线性Bandit与强化学习算法的样本复杂度如何?
主要发现
- 即使对于具有确定性奖励的一层神经网络Bandit,全局收敛在统计上也是不可行的,其样本需求随输入维度呈指数增长。
- 所提出的ViOlin算法可证明收敛至近似局部最大值,其样本复杂度关于模型类的序列Rademacher复杂度呈多项式依赖。
- 对于具有有限或稀疏模型类的线性Bandit,ViOlin实现了与模型类大小对数成比例的局部遗憾界。
- 在两层神经网络Bandit中,算法实现了依赖于模型序列Rademacher复杂度的局部遗憾界,而非输入维度。
- 理论分析表明,在非线性设置中,乐观性会导致过度探索,而虚拟曲率可实现更高效且稳定的收敛。
- 本文证明了一维神经网络的Eluder维度无法被多项式有界,从而否定了先前用于非线性动态的复杂度度量方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。