Skip to main content
QUICK REVIEW

[论文解读] Finite-Sample Analysis of Stochastic Approximation Using Smooth Convex Envelopes

Zaiwei Chen, Siva Theja Maguluri|arXiv (Cornell University)|Feb 3, 2020
Advanced Bandit Algorithms Research参考文献 45被引用 13
一句话总结

本论文在任意收缩范数和仿射噪声缩放条件下,为随机逼近(SA)建立了有限样本收敛界,采用基于广义Moreau包络的光滑李雅普诺夫函数。该方法实现了与状态空间大小的对数依赖关系,并首次为离策略TD学习中的V-trace算法提供了收敛速率,同时在同策略Q-learning中恢复了当前最优结果。

ABSTRACT

Stochastic Approximation (SA) is a popular approach for solving fixed-point equations where the information is corrupted by noise. In this paper, we consider an SA involving a contraction mapping with respect to an arbitrary norm, and show its finite-sample error bounds while using different stepsizes. The idea is to construct a smooth Lyapunov function using the generalized Moreau envelope, and show that the iterates of SA have negative drift with respect to that Lyapunov function. Our result is applicable in Reinforcement Learning (RL). In particular, we use it to establish the first-known convergence rate of the V-trace algorithm for off-policy TD-learning. Moreover, we also use it to study TD-learning in the on-policy setting, and recover the existing state-of-the-art results for $Q$-learning. Importantly, our construction results in only a logarithmic dependence of the convergence bound on the size of the state-space.

研究动机与目标

  • 在收缩算子作用于任意范数且噪声具有仿射条件二阶矩时,为随机逼近提供有限样本收敛保证。
  • 解决在噪声无界且收缩发生在非欧几里得范数(如ℓ∞)的强化学习设置中缺乏收敛界的问题。
  • 在离策略时序差分学习中,首次建立V-trace算法的已知收敛速率。
  • 通过统一框架恢复同策略Q-learning的当前最优收敛速率。
  • 实现与状态空间维度的对数依赖关系,优于以往工作中的多项式或二次依赖关系。

提出的方法

  • 利用广义Moreau包络构造光滑李雅普诺夫函数,以分析SA迭代的漂移行为。
  • 使用光滑凸包络定义李雅普诺夫函数,确保在SA更新规则下具有负漂移。
  • 通过分析李雅普诺夫函数的条件期望,推导出有限样本误差界。
  • 通过假设噪声的条件二阶矩与当前迭代值的平方范数呈仿射关系,处理无界噪声。
  • 将该框架应用于离策略(V-trace)和同策略(Q-learning)强化学习设置。
  • 在常数步长和递减步长下推导收敛速率,并明确其对状态空间维度的依赖关系。

实验结果

研究问题

  • RQ1当收缩范数为任意范数且噪声具有仿射二阶矩缩放时,能否为随机逼近建立有限样本收敛界?
  • RQ2所提出的李雅普诺夫函数构造是否能实现与状态空间大小呈对数依赖关系的更紧界?
  • RQ3该框架能否用于推导离策略TD学习中V-trace算法的首个收敛速率?
  • RQ4该方法是否能在同一理论框架下恢复同策略Q-learning的现有最优结果?
  • RQ5在该通用设置下,步长选择(常数 vs. 递减)对收敛速率有何影响?

主要发现

  • 论文首次为离策略TD学习中的V-trace算法建立了有限样本收敛速率,在递减步长下收敛速率为O(1/k)。
  • 收敛界对状态空间大小d仅表现出对数依赖关系,具体在收缩范数为ℓ∞时为log(d)。
  • 对于同策略Q-learning,该框架在适当的步长选择下恢复了当前最优的O(1/k)收敛速率。
  • 在常数步长下,该方法实现了几何收敛,当收缩范数为ℓ∞时,界对d仅呈对数依赖。
  • 广义Moreau包络使得光滑李雅普诺夫函数成为可能,即使在无界噪声且具有仿射二阶矩时,也能确保负漂移。
  • 该方法可推广至非欧几里得范数,适用于收缩发生在ℓ∞或加权ℓ∞范数下的更广泛强化学习算法类别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。