Skip to main content
QUICK REVIEW

[论文解读] Corruption-robust exploration in episodic reinforcement learning

Thodoris Lykouris, Max Simchowitz|arXiv (Cornell University)|Nov 20, 2019
Advanced Bandit Algorithms Research参考文献 43被引用 18
一句话总结

本文提出了一种新颖的、对噪声鲁棒的 episodic 强化学习探索框架,结合了不确定性下的乐观性与动作消除原则,可在独立同分布(i.i.d.)设置下实现近似最优遗憾,在奖励和转移过程遭受对抗性噪声污染时也能实现平滑退化。该方法首次为具有非 i.i.d. 转移动态的 bandit-feedback episodic RL 提供了次线性遗憾保证,适用于表格型和线性 MDP。

ABSTRACT

We initiate the study of multi-stage episodic reinforcement learning under adversarial corruptions in both the rewards and the transition probabilities of the underlying system extending recent results for the special case of stochastic bandits. We provide a framework which modifies the aggressive exploration enjoyed by existing reinforcement learning approaches based on "optimism in the face of uncertainty", by complementing them with principles from "action elimination". Importantly, our framework circumvents the major challenges posed by naively applying action elimination in the RL setting, as formalized by a lower bound we demonstrate. Our framework yields efficient algorithms which (a) attain near-optimal regret in the absence of corruptions and (b) adapt to unknown levels corruption, enjoying regret guarantees which degrade gracefully in the total corruption encountered. To showcase the generality of our approach, we derive results for both tabular settings (where states and actions are finite) as well as linear-function-approximation settings (where the dynamics and rewards admit a linear underlying representation). Notably, our work provides the first sublinear regret guarantee which accommodates any deviation from purely i.i.d. transitions in the bandit-feedback model for episodic reinforcement learning.

研究动机与目标

  • 解决标准强化学习算法在 episodic 学习过程中对奖励和转移动态中对抗性污染的脆弱性问题。
  • 克服现有方法——不确定性下的乐观性与简单动作消除——在多阶段强化学习中面对对抗性污染时的局限性。
  • 设计一种计算高效的算法,在无污染时保持近似最优遗憾,并在污染程度增加时实现平滑退化。
  • 为具有非 i.i.d. 转移动态的 bandit-feedback episodic RL 提供首个次线性遗憾保证。
  • 将鲁棒性扩展至 episodic MDP 中的表格型和线性函数逼近设置。

提出的方法

  • 提出一种混合框架,将不确定性下的乐观性与动作消除原则相结合,以增强对对抗性污染的鲁棒性。
  • 设计一种分层探索策略,利用多级置信区间和动作消除阈值,过滤掉被污染的轨迹。
  • 使用自归一化的鞅集中不等式,对受污染反馈下的估计误差进行有高概率保证的界控。
  • 使用主策略协调多级探索,根据观测到的污染程度动态调整。
  • 应用 Azuma-Hoeffding 和 Azuma-Bernstein 不等式,控制奖励和转移估计误差中的鞅差分。
  • 通过有界范数的值函数和特征建模,在 MDP 中利用线性函数逼近,实现在污染下的可扩展学习。

实验结果

研究问题

  • RQ1我们能否设计一种在 episodic RL 中的探索策略,即使部分 episode 在奖励和转移过程中被污染,仍能保持有效性?
  • RQ2如何调和不确定性下的乐观性原则与动作消除,以避免在污染下产生指数级遗憾?
  • RQ3在 bandit-feedback episodic RL 中,探索效率与污染鲁棒性之间的根本权衡是什么?
  • RQ4当转移过程非 i.i.d. 时,我们能否在对抗性污染下实现 episodic RL 的次线性遗憾?这一设置此前尚未被解决。
  • RQ5在未知污染水平下,线性 MDP 中污染鲁棒强化学习的最紧致遗憾界是什么?

主要发现

  • 所提算法在线性 MDP 中的遗憾界为 Õ(√(d³ + dA)K · CH⁴ · ln³(TAd/δ) + √(dK) · C²H⁵ · ln²(T/δ)),其中 C 为被污染的 episode 数量。
  • 遗憾随 C 的增加而平滑退化:当 C = 0 时保持近似最优性能,即使在对抗性污染下,其随 T 的增长也保持次线性。
  • 该框架首次为具有 bandit-feedback 和非 i.i.d. 转移动态的 episodic RL 提供了次线性遗憾保证,相较于先前工作具有显著进步。
  • 该算法计算高效,无需预先知晓 C,通过自适应置信区间适应未知的污染水平。
  • 分析建立了下界,表明简单动作消除会导致 H 的指数级遗憾,从而证明了所提混合框架的必要性。
  • 在无污染时,该方法实现了近似最优遗憾,同时对奖励和转移过程中的任意对抗性污染均保持鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。