Skip to main content
QUICK REVIEW

[论文解读] Convergence Guarantees for Deep Epsilon Greedy Policy Learning

Michael Rawson, Radu Bălan|arXiv (Cornell University)|Dec 2, 2021
Advanced Bandit Algorithms Research被引用 6
一句话总结

本文为使用深度神经网络进行非线性函数逼近的上下文Bandit问题中的Deep Epsilon Greedy策略学习提供了理论收敛保证。证明了当探索率 $\epsilon_t = 1/t^{1/3}$ 时,期望遗憾几乎必然收敛至零,并通过基于MNIST的非线性强化学习任务在实验中验证了该结论,其中更深的网络能够收敛,而更简单的网络则不能。

ABSTRACT

Policy learning is a quickly growing area. As robotics and computers control day-to-day life, their error rate needs to be minimized and controlled. There are many policy learning methods and bandit methods with provable error rates that accompany them. We show an error or regret bound and convergence of the Deep Epsilon Greedy method which chooses actions with a neural network's prediction. We also show that Epsilon Greedy method regret upper bound is minimized with cubic root exploration. In experiments with the real-world dataset MNIST, we construct a nonlinear reinforcement learning problem. We witness how with either high or low noise, some methods do and some do not converge which agrees with our proof of convergence.

研究动机与目标

  • 在使用深度神经网络进行非线性函数逼近的条件下,建立Deep Epsilon Greedy策略学习的理论收敛保证。
  • 确定在存在神经网络逼近误差的情况下,能够最小化遗憾的最优探索调度 $\epsilon_t$。
  • 通过基于MNIST数据集的非线性上下文Bandit设置,对理论发现进行实证验证。
  • 证明模型容量(例如神经网络的深度)对收敛性具有关键影响,浅层网络即使采用适当的探索策略也无法收敛。

提出的方法

  • 使用随时间变化的探索率 $\epsilon_t = 1/t^p$ 的Deep Epsilon Greedy,其中 $p$ 经优化以实现收敛。
  • 为每个动作 $j$ 使用独立的神经网络 $\Phi_j$,基于历史状态-动作-奖励元组对预期奖励进行预测。
  • 应用Gy€rfi等人(2002)提出的神经网络泛化界来控制逼近误差,假设输入和输出有界。
  • 利用集中不等式和对 $K$ 个动作的并集界,推导出高概率遗憾界。
  • 引入一种改进的探索率 $\epsilon_t = 1/t^{1/3}$,以最小化渐近遗憾率。
  • 采用一种训练流程,每20个时间步使用小批量SGD(16个周期,初始初始学习率为 $10^{-3}$)更新每个特定动作的网络。

实验结果

研究问题

  • RQ1在使用深度神经网络函数逼近的Deep Epsilon Greedy中,最小化遗憾界所需的最优探索率 $\epsilon_t$ 是什么?
  • RQ2在非线性上下文Bandit设置中,Deep Epsilon Greedy方法在何种条件下会收敛到最优策略?
  • RQ3神经网络的容量(例如深度)在实践中如何影响收敛性和遗憾?
  • RQ4为何线性模型(如LinUCB和线性回归)在像基于MNIST的Bandit任务这样的非线性问题中表现不佳?
  • RQ5理论遗憾界是否与真实世界中存在噪声和非线性特征的环境下的实际性能相匹配?

主要发现

  • 最优探索率 $\epsilon_t = 1/t^{1/3}$ 最小化了渐近遗憾界,实现了 $t^{-1/3}$ 的收敛速率。
  • 当 $\epsilon_t = 1/t$ 时,遗憾界以 $t^{-1} + \sqrt{\frac{\ln \ln t}{\ln t}}$ 的速率衰减,慢于在 $p=1/3$ 时实现的 $t^{-1/3}$ 速率。
  • 使用三个卷积层的Deep Epsilon Greedy方法在低噪声和高噪声的MNIST实验中均收敛到最优策略,达到接近最优的归一化奖励。
  • 仅使用单个全连接层的简单Deep Epsilon Greedy方法由于模型容量不足而无法收敛,尽管采用了相同的探索调度。
  • 线性模型(LinUCB、线性回归)和均匀随机策略在非线性MNIST任务中表现不佳,证实线性函数逼近无法适应非线性奖励结构。
  • 深度网络版本的实证遗憾收敛速率与理论预测一致,归一化遗憾衰减速率约为 $t^{-1/2}$,与理论上的 $t^{-1/3}$ 边界相符。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。