[论文解读] Corruption-Robust Offline Reinforcement Learning
该论文提出了一种抗数据污染的离线强化学习算法,在对抗性数据污染下实现近最优性能,利用鲁棒监督学习预言机和一种新颖的悲观主义奖励机制。它在线性MDP中建立了基本的 $Ω(d\varepsilon)$ 最优性差距,并证明在离线设置下,已知污染水平 $ε$ 是实现无偏学习的必要条件——凸显了离线与在线鲁棒强化学习之间的关键难度差距。
We study the adversarial robustness in offline reinforcement learning. Given a batch dataset consisting of tuples $(s, a, r, s')$, an adversary is allowed to arbitrarily modify $ε$ fraction of the tuples. From the corrupted dataset the learner aims to robustly identify a near-optimal policy. We first show that a worst-case $Ω(dε)$ optimality gap is unavoidable in linear MDP of dimension $d$, even if the adversary only corrupts the reward element in a tuple. This contrasts with dimension-free results in robust supervised learning and best-known lower-bound in the online RL setting with corruption. Next, we propose robust variants of the Least-Square Value Iteration (LSVI) algorithm utilizing robust supervised learning oracles, which achieve near-matching performances in cases both with and without full data coverage. The algorithm requires the knowledge of $ε$ to design the pessimism bonus in the no-coverage case. Surprisingly, in this case, the knowledge of $ε$ is necessary, as we show that being adaptive to unknown $ε$ is impossible.This again contrasts with recent results on corruption-robust online RL and implies that robust offline RL is a strictly harder problem.
研究动机与目标
- 研究在数据污染下离线强化学习中的对抗鲁棒性,其中攻击者可污染数据集的最多 $\varepsilon$ 比例。
- 在 $\varepsilon$-污染条件下,建立线性MDP中最优性差距的信息论下界。
- 设计基于最小二乘值迭代(LSVI)的鲁棒变体,利用鲁棒监督学习预言机,实现近最优性能。
- 探究在离线设置下,无偏学习(即在不知道 $\varepsilon$ 的情况下学习)是否可能,与在线RL结果形成对比。
- 通过基于比较策略相对条件数的偏覆盖条件,弱化离线RL中的完整数据覆盖假设。
提出的方法
- 提出一种鲁棒LS-VI算法,整合鲁棒监督学习预言机以处理离线强化学习中的污染数据。
- 引入一种新颖的悲观主义奖励项,其依赖于已知的污染水平 $\varepsilon$,以确保在缺乏完整数据覆盖时的鲁棒性。
- 采用基于相对条件数的假设,以放松完整数据覆盖要求,从而在部分覆盖条件下实现学习。
- 使用双环境构造方法,证明在离线强化学习中,无偏学习(即不知道 $\varepsilon$)是不可能的,即使存在辅助策略也是如此。
- 分析在污染条件下线性MDP中的最坏情况最优性差距,表明下界为 $\Omega(Hd\varepsilon)$。
- 证明所提出的算法在完整覆盖和部分覆盖设置下均能实现与下界近乎匹配的性能。
实验结果
研究问题
- RQ1在 $\varepsilon$-比例数据污染下,离线强化学习中鲁棒最优策略识别的根本信息论极限是什么?
- RQ2鲁棒离线强化学习算法是否能在完整覆盖和部分覆盖假设下均实现近最优性能?
- RQ3在离线强化学习中,无偏学习(即在不知道 $\varepsilon$ 的情况下实现良好性能)是否可能,与在线强化学习形成对比?
- RQ4MDP的相对条件数如何影响在部分数据覆盖下鲁棒离线学习的可行性?
- RQ5为何在面对数据污染时,鲁棒离线强化学习严格难于鲁棒在线强化学习?其结构差异如何解释这一差距?
主要发现
- 在 $\varepsilon$-污染下,线性MDP中的 $\Omega(Hd\varepsilon)$ 最优性差距不可避免,即使仅奖励被污染。
- 所提出的鲁棒LS-VI算法在完整覆盖和部分覆盖设置下均实现了近最优性能,与下界仅相差对数因子。
- 在缺乏完整数据覆盖的情况下,知道 $\varepsilon$ 是鲁棒学习的必要条件——无偏学习不可能实现,这与在线RL形成关键分离。
- 基于相对条件数的偏覆盖假设,即使在无污染情况下,也严格弱于Jin等人(2020)提出的完整覆盖假设。
- 用于证明必须知道 $\varepsilon$ 的构造依赖于离线设置中无法收集在线策略数据,这导致在污染下无法准确估计。
- 本文指出,部分覆盖边界中的 $\sqrt{\varepsilon}$ 依赖关系相比下界中的 $\varepsilon$ 依赖关系为次优,提示未来在奖励设计上仍有优化空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。