[论文解读] Factored Adaptation for Non-Stationary Reinforcement Learning
本文提出FANS-RL,一种用于非平稳强化学习的因子化适应框架,通过解耦的潜在因子和因果结构建模动态和奖励的时间变化。通过联合学习因子化MDP与随时间演化的改变因子,FANS-RL在返回值、表征紧凑性及鲁棒性方面均表现出色,在多种非平稳设置下优于先前方法,在连续控制与机器人操作基准测试中表现优异。
Dealing with non-stationarity in environments (e.g., in the transition dynamics) and objectives (e.g., in the reward functions) is a challenging problem that is crucial in real-world applications of reinforcement learning (RL). While most current approaches model the changes as a single shared embedding vector, we leverage insights from the recent causality literature to model non-stationarity in terms of individual latent change factors, and causal graphs across different environments. In particular, we propose Factored Adaptation for Non-Stationary RL (FANS-RL), a factored adaption approach that learns jointly both the causal structure in terms of a factored MDP, and a factored representation of the individual time-varying change factors. We prove that under standard assumptions, we can completely recover the causal graph representing the factored transition and reward function, as well as a partial structure between the individual change factors and the state components. Through our general framework, we can consider general non-stationary scenarios with different function types and changing frequency, including changes across episodes and within episodes. Experimental results demonstrate that FANS-RL outperforms existing approaches in terms of return, compactness of the latent state representation, and robustness to varying degrees of non-stationarity.
研究动机与目标
- 为解决现实世界强化学习中的非平稳性挑战,其中环境动态与奖励函数随时间变化。
- 通过将变化建模为解耦的、随时间演化的潜在因子而非共享嵌入,提升适应效率。
- 在标准可识别性假设下,实现对转移与奖励函数中因果结构的恢复。
- 开发一个统一框架,支持以不同频率发生的单episode内与跨episode变化。
- 与最先进方法相比,展示在返回值、潜在表征紧凑性与鲁棒性方面的性能提升。
提出的方法
- 形式化定义了因子化非平稳MDP(FN-MDP),在因子化MDP基础上引入随时间演化的潜在变化因子,并将其建模为马尔可夫过程。
- 提出一种因果结构学习框架,用于识别状态转移与奖励的因果图,并恢复变化因子与状态分量之间的部分结构。
- 提出FANS-RL,一种联合模型估计与策略优化框架,通过交替进行FN-MDP学习与策略适应实现。
- 采用FN-VAE,一种包含推理、动态与解码网络的神经架构,使用LSTM进行时间建模,并通过变分推理估计潜在因子。
- 使用多组件损失函数,包含重构、预测、KL、稀疏性与平滑性项,并采用自适应加权以确保训练稳定性。
- 通过学习低维、随时间演化的改变因子表征,将AdaRL框架适配至非平稳设置,实现快速策略适应。
实验结果
研究问题
- RQ1在标准假设下,能否识别非平稳MDP中转移与奖励函数的因果结构?
- RQ2能否在非平稳环境中恢复单个变化因子与状态分量之间的部分因果结构?
- RQ3与共享嵌入方法相比,通过解耦的潜在变化因子建模非平稳性,是否能提升策略性能与表征紧凑性?
- RQ4所提出的框架能否同时处理在单个episode内与跨episode发生的离散与连续变化?
- RQ5FANS-RL在动态与奖励函数非平稳程度变化时的鲁棒性如何?
主要发现
- FANS-RL在所有评估基准上均获得比最先进方法更高的累积回报,包括Half-Cheetah、Sawyer-Reaching、Sawyer-Peg与Minitaur。
- FANS-RL学习到的潜在状态表征更加紧凑,维度降低至40个特征,优于其他方法。
- FANS-RL对非平稳性表现出卓越鲁棒性,在动态与奖励的高频或复杂变化下仍能保持高性能。
- 在标准可识别性假设下,该框架成功恢复了转移与奖励函数的因果结构,且对变化因子实现了部分结构恢复。
- FN-VAE架构实现了FN-MDP与策略适应的有效联合学习,在元测试场景中优于TRIO与VariBAD。
- 消融研究证实,对变化因子的解耦建模相比共享嵌入方法,能带来更好的泛化能力与更快的适应速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。