[论文解读] Time Discretization-Invariant Safe Action Repetition for Policy Gradient Methods
本文提出安全动作重复(SAR),一种时间离散化不变的策略梯度(PG)算法方法,可在状态空间中学习到的安全部位内实现持久动作。通过在智能体离开其安全部位时停止动作重复,SAR 确保了对随机性的鲁棒性,并在不同时间尺度 δ 下保持性能,相较于先前的 δ 不变方法,在八个 MuJoCo 环境中均表现出更优性能,涵盖确定性和随机设置。
In reinforcement learning, continuous time is often discretized by a time scale $δ$, to which the resulting performance is known to be highly sensitive. In this work, we seek to find a $δ$-invariant algorithm for policy gradient (PG) methods, which performs well regardless of the value of $δ$. We first identify the underlying reasons that cause PG methods to fail as $δ o 0$, proving that the variance of the PG estimator can diverge to infinity in stochastic environments under a certain assumption of stochasticity. While durative actions or action repetition can be employed to have $δ$-invariance, previous action repetition methods cannot immediately react to unexpected situations in stochastic environments. We thus propose a novel $δ$-invariant method named Safe Action Repetition (SAR) applicable to any existing PG algorithm. SAR can handle the stochasticity of environments by adaptively reacting to changes in states during action repetition. We empirically show that our method is not only $δ$-invariant but also robust to stochasticity, outperforming previous $δ$-invariant approaches on eight MuJoCo environments with both deterministic and stochastic settings. Our code is available at https://vision.snu.ac.kr/projects/sar.
研究动机与目标
- 为解决策略梯度方法对时间离散化尺度 δ 的敏感性问题,该问题导致 δ→0 时因梯度方差爆炸和探索受限而性能下降。
- 克服先前动作重复方法的局限性,这些方法由于固定重复周期,无法对随机环境中的意外事件做出响应。
- 开发一种通用、即插即用的方法,兼容现有 PG 算法(如 PPO、TRPO、A2C),实现 δ 不变性,且无需无限训练步数或梯度访问。
- 通过在智能体离开状态空间中学习到的安全部位时动态终止动作重复,确保对环境随机性的鲁棒性。
- 通过实证验证,所提方法在广泛 δ 值范围内保持性能,并在确定性和随机 MuJoCo 环境中均优于现有 δ 不变基线方法。
提出的方法
- SAR 通过在状态空间中学习动作和安全部位来扩展 PG 算法,安全部位通过参考状态的距离函数定义,该区域内动作被重复执行。
- 安全部位通过归一化状态维度的距离函数进行学习,确保尺度不变性,并在不同环境中实现一致行为。
- 当智能体状态离开安全部位时,动作重复立即终止,从而能够对意外环境变化或扰动做出快速响应。
- 该方法兼容任意 PG 算法,通过修改策略输出以包含动作和安全部位参数,可无缝集成。
- 所有环境中均使用距离阈值 $ d_{\text{max}} = 0.5 $ 定义安全部位,策略使用标准 PG 目标进行训练,重复期间返回计算进行相应修改。
- 通过将决策频率与动作持续时间解耦,该方法确保 δ 不变性,从而在任意时间步 δ 下保持稳定性能。
实验结果
研究问题
- RQ1为何当时间离散化尺度 δ 趋近于零时,策略梯度方法会失效?其性能下降的根本原因是什么?
- RQ2在连续控制环境中,如何使动作重复对随机性具有鲁棒性,特别是在动作执行期间发生意外扰动时?
- RQ3基于安全部位的动作重复机制是否能在不依赖无限训练步数或奖励梯度访问的前提下,实现策略梯度方法的 δ 不变性?
- RQ4与现有 δ 不变方法相比,所提出的 SAE(安全动作重复,SAR)方法在多样化 MuJoCo 环境中的性能和鲁棒性如何?
- RQ5SAR 在不同 δ 值(包括极小 δ)下,在确定性和随机设置中,其性能保持程度如何?
主要发现
- SAR 在所有测试的 MuJoCo 环境中均实现 δ 不变性,在 δ = 0.0005s 到 δ = 0.05s 的时间离散化尺度范围内保持一致性能。
- 在存在强外部作用力的随机设置下,SAR 在全部八个环境中均优于所有基线方法(包括 FiGAR-C 和 DAU),展现出卓越的鲁棒性。
- 在确定性环境中,SAR 实现了最先进性能,超越 PPO、TRPO 和 A2C 基线方法,在所有 δ 设置下表现更优。
- 通过在安全部位内实现持久动作,SAR 有效防止了 δ→0 时的梯度方差爆炸,解决了标准 PG 方法的关键失效模式。
- 实证结果表明,SAR 保持了高样本效率和稳定性,所有 δ 值下均实现训练收敛,且无需超参数调优。
- 消融研究证实,安全部位机制对鲁棒性至关重要,若移除该机制,则在随机性条件下性能显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。