[论文解读] Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning
本文提出了一种针对TD3-BC的松弛策略约束,该方法在离线训练过程中动态降低行为克隆(BC)的影响,从而生成更优的策略,其性能超越了原始基线。该方法在D4RL基准上表现优异,并可在不造成性能下降的情况下实现稳定的在线微调。
The ability to discover optimal behaviour from fixed data sets has the potential to transfer the successes of reinforcement learning (RL) to domains where data collection is acutely problematic. In this offline setting, a key challenge is overcoming overestimation bias for actions not present in data which, without the ability to correct for via interaction with the environment, can propagate and compound during training, leading to highly sub-optimal policies. One simple method to reduce this bias is to introduce a policy constraint via behavioural cloning (BC), which encourages agents to pick actions closer to the source data. By finding the right balance between RL and BC such approaches have been shown to be surprisingly effective while requiring minimal changes to the underlying algorithms they are based on. To date this balance has been held constant, but in this work we explore the idea of tipping this balance towards RL following initial training. Using TD3-BC, we demonstrate that by continuing to train a policy offline while reducing the influence of the BC component we can produce refined policies that outperform the original baseline, as well as match or exceed the performance of more complex alternatives. Furthermore, we demonstrate such an approach can be used for stable online fine-tuning, allowing policies to be safely improved during deployment.
研究动机与目标
- 解决离线强化学习中的过估计偏差问题,即当动作不在数据集中时会导致误差累积。
- 克服TD3-BC中固定行为克隆(BC)权重的局限性,该局限性限制了策略在演示行为之外的改进。
- 在离线预训练后实现稳定的在线微调,且在部署过程中不会出现性能崩溃。
- 在保持简单性并仅需最少超参数调优的前提下,实现与或超越当前最先进性能的目标。
提出的方法
- 引入一种动态BC加权调度策略,使行为克隆的影响在离线训练过程中随时间逐渐减弱。
- 将此松弛机制应用于TD3-BC,修改策略更新目标,使其逐渐从BC引导的行为转向策略梯度优化。
- 对BC系数α采用衰减调度,初始值较高以防止过估计,随后逐渐降低,以允许探索更优动作。
- 对Q值和状态进行归一化,以稳定训练并确保在不同环境中的一致缩放。
- 使用优化后的策略进行在线微调,采用标准强化学习更新规则,确保部署过程中的稳定性。
- 通过D4RL-v2基准在50次评估中计算平均归一化得分及其标准差来跟踪性能。
实验结果
研究问题
- RQ1在离线训练过程中动态降低行为克隆组件是否能提升策略性能,使其超越固定BC基线?
- RQ2所提出的策略优化过程是否能提升在次优或中等回放缓冲区数据集上的性能,其中TD3-BC表现不佳?
- RQ3优化后的策略是否可以安全地进行在线微调,而不会在部署过程中出现性能下降?
- RQ4优化后策略在多样化离线强化学习基准上的性能与当前最先进方法相比如何?
- RQ5与标准TD3-BC策略相比,从优化后的离线策略开始时,是否能保持在线微调的稳定性?
主要发现
- 优化后的策略(PR)在所有中等和中等回放缓冲区D4RL任务上均优于原始TD3-BC基线,包括hopper-medium-replay(91.9 ± 11.1 vs. 91.5 ± 15.8)。
- 在专家级数据上,优化后的策略与TD3-BC或当前最先进方法相当或更优,在walker2d-medium-expert上达到119.1 ± 2.8的性能。
- 在线微调同时提升了基线和优化后的策略,其中优化后的策略在fine-tuning后于walker2d-expert上达到121.4 ± 1.9的性能。
- 学习曲线显示,在线微调期间性能稳定,所有环境中均无明显性能下降,仅hopper-medium-expert略有波动。
- 该方法保持了简单性,仅需极少的超参数调优,其性能超越了更复杂的替代方案,且实现更简便。
- 该方法对数据质量具有鲁棒性:在次优数据集上性能提升最为显著,而TD3-BC在这些数据集上表现最差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。