[论文解读] Double Check Your State Before Trusting It: Confidence-Aware Bidirectional Offline Model-Based Imagination
本文提出了一种名为置信度感知双向离线模型基想象(CABI)的数据增强方法,通过双重新验证机制提升无模型离线强化学习的性能:仅当前向与后向动态模型均一致认可的状态才被信任。CABI在D4RL基准测试中显著提升性能,超越了包括无模型与模型基基线在内的最先进方法。
The learned policy of model-free offline reinforcement learning (RL) methods is often constrained to stay within the support of datasets to avoid possible dangerous out-of-distribution actions or states, making it challenging to handle out-of-support region. Model-based RL methods offer a richer dataset and benefit generalization by generating imaginary trajectories with either trained forward or reverse dynamics model. However, the imagined transitions may be inaccurate, thus downgrading the performance of the underlying offline RL method. In this paper, we propose to augment the offline dataset by using trained bidirectional dynamics models and rollout policies with double check. We introduce conservatism by trusting samples that the forward model and backward model agree on. Our method, confidence-aware bidirectional offline model-based imagination, generates reliable samples and can be combined with any model-free offline RL method. Experimental results on the D4RL benchmarks demonstrate that our method significantly boosts the performance of existing model-free offline RL algorithms and achieves competitive or better scores against baseline methods.
研究动机与目标
- 解决无模型离线强化学习中的分布外(OOD)状态动作泛化挑战。
- 提升基于模型的离线强化学习中生成的合成轨迹的可靠性,此类方法常受不准确动态模型的影响。
- 引入一种保守的、置信度感知的机制,通过双向动态建模验证生成的过渡。
- 使任意无模型离线强化学习算法均可在不修改架构的前提下受益于高质量、可信的合成轨迹。
- 通过利用前向与后向模型之间的一致性,实现更高的样本效率和在真实世界强化学习基准(如D4RL)上的性能提升。
提出的方法
- 训练双向动态模型:前向模型用于预测下一状态,后向模型用于从未来状态重建先前状态。
- 使用前向与后向滚动预测生成合成轨迹,并应用双重新验证机制验证生成的过渡。
- 基于原始状态与回溯后重建状态之间的相似性定义置信度分数:若后向模型能精确恢复原始状态,则信任前向生成的状态。
- 引入保守的数据增强策略:仅包含前向与后向模型达成一致的过渡,确保可靠性。
- 将增强后的数据集与任意现成的无模型离线强化学习算法(如BCQ、TD3_BC)集成,以提升策略学习效果。
- 使用一致性损失联合训练前向与后向动态模型,最小化原始状态与回溯状态之间的重建误差。
实验结果
研究问题
- RQ1双向动态建模能否提升离线强化学习中合成轨迹的可靠性?
- RQ2基于前向与后向模型一致性的双重验证机制是否能生成更保守且更具泛化能力的策略?
- RQ3该方法是否能在不修改架构的前提下显著提升现有无模型离线强化学习算法的性能?
- RQ4在标准基准测试中,该方法与最先进无模型及模型基离线强化学习方法相比表现如何?
- RQ5置信度感知的数据增强在多大程度上缓解了分布偏移问题并提升了离线强化学习的泛化能力?
主要发现
- CABI+BCQ在Adroit pen-clone任务上的归一化平均得分为54.7 ± 2.0,显著优于BCQ(44.0)及其他基线方法。
- 在MuJoCo Halfcheetah-medium任务上,CABI+TD3_BC得分为45.1 ± 0.1,超过TD3_BC(42.8 ± 0.3),并匹配或超越大多数其他方法。
- CABI+TD3_BC在D4RL MuJoCo基准测试中总得分为1020.7,优于次佳方法(FisherBRC为974.6),并在某些设置下超越了专家级基线。
- 在hopper-expert与walker2d-expert任务上,CABI+TD3_BC分别获得112.4 ± 0.1与108.6 ± 1.5的得分,接近或超过专家表现,并优于CQL与MOPO。
- 该方法在所有D4RL基准任务上均取得具有竞争力或更优的结果,包括包含人类演示与专家演示的任务,展现出强大的泛化能力。
- 消融实验验证了双重验证机制的必要性:移除该机制后性能下降,证实了双向一致性对可靠数据生成的关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。