[论文解读] Offline Reinforcement Learning with Causal Structured World Models
该论文提出 FOCUS,一种基于模型的离线强化学习算法,通过整合因果结构世界模型以提升泛化能力。通过利用改进的 PC 算法结合时间约束以及基于核的独立性检验进行因果发现,FOCUS 在离线强化学习基准测试中表现优于基线方法,通过准确的因果结构学习实现了更高的鲁棒性和样本效率。
Model-based methods have recently shown promising for offline reinforcement learning (RL), aiming to learn good policies from historical data without interacting with the environment. Previous model-based offline RL methods learn fully connected nets as world-models that map the states and actions to the next-step states. However, it is sensible that a world-model should adhere to the underlying causal effect such that it will support learning an effective policy generalizing well in unseen states. In this paper, We first provide theoretical results that causal world-models can outperform plain world-models for offline RL by incorporating the causal structure into the generalization error bound. We then propose a practical algorithm, oFfline mOdel-based reinforcement learning with CaUsal Structure (FOCUS), to illustrate the feasibility of learning and leveraging causal structure in offline RL. Experimental results on two benchmarks show that FOCUS reconstructs the underlying causal structure accurately and robustly. Consequently, it performs better than the plain model-based offline RL algorithms and other causal model-based RL algorithms.
研究动机与目标
- 从理论上证明因果世界模型相较于普通世界模型在离线强化学习中的优势。
- 开发一种实用算法 FOCUS,从离线数据中学习并利用因果结构以提升策略学习性能。
- 解决将因果发现方法应用于强化学习数据的挑战,此类数据通常包含连续变量和时间依赖性。
- 证明因果世界模型可通过减轻离线数据集中虚假相关性来降低泛化误差。
- 在离线强化学习基准上通过实证验证该方法,展示其性能和鲁棒性的提升。
提出的方法
- 通过引入时间约束(未来不能导致过去)扩展 PC 算法,减少条件独立性检验次数并实现因果方向识别。
- 采用基于核的条件独立性(KCI)检验,检测连续变量之间的关系,而无需假设参数化函数形式。
- 提出一种有原则的条件集选择方法,提升结构学习的准确性和鲁棒性。
- 从学习到的因果结构构建因果世界模型,以指导离线 MBRL 中的策略学习。
- 利用因果世界模型预测状态转移并评估策略,从而最小化由虚假相关性引起的误差。
- 将模型应用于离线强化学习任务,在训练策略时使用因果世界模型,同时确保对未见状态的泛化能力。
实验结果
研究问题
- RQ1在离线强化学习中,将因果结构融入世界模型是否能降低泛化误差界?
- RQ2如何将因果发现适配于离线强化学习数据的约束条件,特别是时间依赖性和连续变量?
- RQ3与非因果模型相比,因果世界模型是否能带来更好的策略性能和泛化能力?
- RQ4FOCUS 相较于基线方法,在多大程度上减少了对数据多样性的依赖?
- RQ5因果结构学习的准确性和鲁棒性在多大程度上影响下游策略性能?
主要发现
- 在汽车驾驶和 MuJoCo(倒立摆)基准测试中,FOCUS 的策略回报显著高于基线方法,部分设置下提升高达 40%。
- 在 Random 数据集中,由于准确的因果结构学习,FOCUS 分别比 MOPO 和 LNCM 在策略回报上高出 58.2 和 58.2 分。
- 在 Medium-Replay 数据集中,由于数据多样性高且虚假相关性弱,FOCUS 的性能提升最小,验证了因果模型对数据多样性依赖较低的理论预期。
- 即使在混合数据集中 Medium-Replay 数据比例较低时,FOCUS 仍保持强劲性能,表明其具备更强的泛化能力并显著降低对数据多样性的依赖。
- 消融实验表明,KCI 检验和条件变量选择机制均显著提升了因果结构学习的准确性和鲁棒性。
- LNCM 虽表现出低方差,但其鲁棒性无实际意义,因其预测概率接近 50%,凸显 FOCUS 在结构学习质量上的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。