[论文解读] Making Deep Q-learning methods robust to time discretization
该论文表明,Q-learning 方法在时间步很小时崩溃,并提出一种名为 Deep Advantage Updating (DAU) 的连续时间鲁棒离策略算法,在多种时间离散化下仍然有效,并具有理论支持和实证验证。
Despite remarkable successes, Deep Reinforcement Learning (DRL) is not robust to hyperparameterization, implementation details, or small environment changes (Henderson et al. 2017, Zhang et al. 2018). Overcoming such sensitivity is key to making DRL applicable to real world problems. In this paper, we identify sensitivity to time discretization in near continuous-time environments as a critical factor; this covers, e.g., changing the number of frames per second, or the action frequency of the controller. Empirically, we find that Q-learning-based approaches such as Deep Q- learning (Mnih et al., 2015) and Deep Deterministic Policy Gradient (Lillicrap et al., 2015) collapse with small time steps. Formally, we prove that Q-learning does not exist in continuous time. We detail a principled way to build an off-policy RL algorithm that yields similar performances over a wide range of time discretizations, and confirm this robustness empirically.
研究动机与目标
- 识别近似连续环境中 DRL 对时间离散化的敏感性。
- 证明当时间离散化趋近于零时,Q-learning 收敛到 V 函数。
- 发展并证明一种在不同时间步下仍然鲁棒的离策略算法。
- 提供连续时间极限和实用算法(DAU)的理论基础。
- 在多样化环境中经验性验证所提方法的鲁棒性。
提出的方法
- 将近连续环境框定为具有 delta t 的连续时间 MDP 的离散化,并缩放奖励和折扣以保持有意义的极限。
- 通过定义 A_delta_t(s,a) = (Q_delta_t(s,a) - V_delta_t(s)) / delta t 并与 V 一致性来引入 Advantage Updating,从而获得一个可学习、具有不变量排名信号。
- 将 Q 参数化为 Q_theta(s,a) = V_theta(s) + delta t * A_psi(s,a) 并强制 A(s, pi(s)) = 0 以实现可辨识性。
- 使用重参数化 A_psi(s,a) = barA_psi(s,a) - barA_psi(s, pi(s)) 以确保动作排序的一致性。
- 采用时间步不变的探索,对于连续动作使用 Ornstein-Uhlenbeck 噪声的连续时间极限,对于离散动作采用离散化方法。
- 推导学习率标度 eta_V_delta_t, eta_A_delta_t 与 delta t 成正比,以保证良定义的连续时间极限。
实验结果
研究问题
- RQ1是否可以使基于 Q-learning 的方法在近连续环境中对时间离散化保持不变?
- RQ2当 delta t 趋近于零时,基于 Q 函数的方法有哪些理论极限?
- RQ3能否设计一种离策略算法,在广泛的时间步范围内保持性能?
- RQ4应如何对探索和学习率计划进行标度以实现连续时间极限?
- RQ5当 delta t 变化时,所提方法在标准控制基准上是否经验性地表现出鲁棒性?
主要发现
- Q-learning 在近连续时间下崩溃为 V 函数,使其在连续时间中表现不佳。
- delta t 缩放的优势 (A_delta_t) 保留动作排序信息,且当 delta t -> 0 时存在非退化极限。
- 通过 V 和 delta t A 重参数化的 Q 确保可辨识性,并在不同时间步上实现稳定学习。
- 时步不变探索方案为离散和连续动作都带来有意义的连续时间极限。
- Deep Advantage Updating (DAU) 在若干控制任务中对时间离散化的鲁棒性有所提升,与 vanilla DQN 或 DDPG 相比。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。