[论文解读] Task-Agnostic Online Reinforcement Learning with an Infinite Mixture of Gaussian Processes
本文提出了一种无需预训练即可快速适应未见过的动力学特性的任务无关在线模型强化学习方法,采用无限高斯过程(GPs)混合模型。通过在序列变分推断中引入时间转移先验来建模非平稳环境,该方法能够检测任务切换,重用过往模型,并保持不确定性感知的动力学表征,在动态控制和驾驶场景中优于基线方法。
Continuously learning to solve unseen tasks with limited experience has been extensively pursued in meta-learning and continual learning, but with restricted assumptions such as accessible task distributions, independently and identically distributed tasks, and clear task delineations. However, real-world physical tasks frequently violate these assumptions, resulting in performance degradation. This paper proposes a continual online model-based reinforcement learning approach that does not require pre-training to solve task-agnostic problems with unknown task boundaries. We maintain a mixture of experts to handle nonstationarity, and represent each different type of dynamics with a Gaussian Process to efficiently leverage collected data and expressively model uncertainty. We propose a transition prior to account for the temporal dependencies in streaming data and update the mixture online via sequential variational inference. Our approach reliably handles the task distribution shift by generating new models for never-before-seen dynamics and reusing old models for previously seen dynamics. In experiments, our approach outperforms alternative methods in non-stationary tasks, including classic control with changing dynamics and decision making in different driving scenarios.
研究动机与目标
- 解决元学习和持续学习在任务分布未知且任务边界不明确的真实世界设置中的局限性。
- 在无需预训练或显式任务边界的情况下,实现在在线流式环境中的新动力学的快速适应。
- 缓解在动力学显著不同的非平稳机器人任务中出现的灾难性遗忘和知识迁移问题。
- 通过在序列推理框架中引入转移先验,对动力学变化中的时间依赖性进行建模。
- 通过基于高斯过程的动力学模型在专家混合设置中实现数据效率和不确定性量化。
提出的方法
- 使用无限高斯过程(GPs)混合模型来表示多样的系统动力学,支持对无限多个动力学模式的建模。
- 应用序列变分推断,在新数据流持续输入时实时更新混合模型,支持在线学习。
- 引入源自狄利克雷过程的转移先验,以编码连续动力学之间的时间依赖性,提升任务切换检测能力。
- 采用稀疏GP近似与变分推断,以保持计算可扩展性和数据效率。
- 使用粘性参数以促进模型持久性,减少在线适应过程中虚假模型的创建。
- 在每个时间步通过将观测结果分配给现有或新的GP专家来执行任务识别,从而实现对先前学习到的动力学的重用。
实验结果
研究问题
- RQ1基于模型的RL智能体是否能在无预训练的情况下,快速适应非平稳环境中未见过的动力学?
- RQ2如何对流式动力学中的时间依赖性进行建模,以提升任务切换检测能力?
- RQ3在在线推理下,具有在线学习能力的GP混合模型能否有效应对系统动力学的剧烈变化,同时避免灾难性遗忘?
- RQ4在任务边界未知的环境中,该方法与元学习和持续学习基线方法相比表现如何?
- RQ5转移先验在非独立同分布(non-i.i.d.)动态环境中在多大程度上提升了性能?
主要发现
- 所提方法在非平稳的CartPole-SwingUp和Highway-Intersection任务中,优于基于MAML的模型无关RL和基于DNN的基线方法,尤其在动力学发生切换时表现更优。
- 该方法能够实时检测任务边界,并通过创建新GP模型或重用现有模型,快速适应新动力学。
- 与独立同分布(i.i.d.)假设相比,使用转移先验显著提升了任务切换检测性能,减少了振荡和性能下降。
- 无限GPs混合模型支持多模态预测分布,可在不发生灾难性遗忘的前提下,稳健处理截然不同的动力学。
- 与深度神经网络相比,该方法在数据效率和不确定性量化方面表现更优,尤其在每个动力学模式数据量有限时。
- 实验表明,该方法可避免使MAML和基于DNN的模型陷入局部极小值,尤其在任务间动力学发生显著变化时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。