[论文解读] Trajectory-wise Multiple Choice Learning for Dynamics Generalization in Reinforcement Learning
该论文提出轨迹级多选学习(T-MCL),一种基于模型的强化学习方法,通过学习一个具有多头结构的动力学模型,实现对具有不同动力学特性的环境的泛化。通过使用轨迹级“最优解”损失来为每个动力学聚类专门化预测头,并结合上下文学习实现在线适应,T-MCL在CrippledAnt环境上实现了平均回报3.5倍于先前方法的优越零样本泛化性能。
Model-based reinforcement learning (RL) has shown great potential in various control tasks in terms of both sample-efficiency and final performance. However, learning a generalizable dynamics model robust to changes in dynamics remains a challenge since the target transition dynamics follow a multi-modal distribution. In this paper, we present a new model-based RL algorithm, coined trajectory-wise multiple choice learning, that learns a multi-headed dynamics model for dynamics generalization. The main idea is updating the most accurate prediction head to specialize each head in certain environments with similar dynamics, i.e., clustering environments. Moreover, we incorporate context learning, which encodes dynamics-specific information from past experiences into the context latent vector, enabling the model to perform online adaptation to unseen environments. Finally, to utilize the specialized prediction heads more effectively, we propose an adaptive planning method, which selects the most accurate prediction head over a recent experience. Our method exhibits superior zero-shot generalization performance across a variety of control tasks, compared to state-of-the-art RL methods. Source code and videos are available at https://sites.google.com/view/trajectory-mcl.
研究动机与目标
- 为解决在真实世界机器人场景等动力学特性意外改变时,基于模型的强化学习中泛化能力差的问题。
- 学习一个能够捕捉多模态转移分布的动力学模型,且无需事先了解环境信息。
- 通过上下文条件化建模,实现在未见环境中的在线适应。
- 通过基于近期经验动态选择最合适的预测头,提升规划效率与准确性。
- 在具有不同动力学特性的多样化控制任务中,实现更优的零样本泛化性能。
提出的方法
- 提出一种轨迹级“最优解”损失,仅在轨迹片段中更新最准确的预测头,从而实现基于动力学相似性的无监督环境聚类。
- 采用上下文条件化的多头动力学模型,其中潜在上下文向量编码过往经验,以条件化地预测特定环境的动力学特性。
- 使用自适应规划,基于最近经验窗口内最准确的预测头选择动作,从而有效定位最近的动力学聚类。
- 通过一种新型损失函数端到端训练多头模型,鼓励每个动力学模式下的预测头实现专业化,且无需显式监督。
- 利用具有多个头的动力学模型,每个头学习预测特定动力学聚类的转移。
- 应用t-SNE可视化,确认上下文嵌入按动力学类型分离,验证了有效表征学习。
实验结果
研究问题
- RQ1多头动力学模型是否能在无显式聚类监督的情况下,学会在不同动力学聚类中实现专业化?
- RQ2上下文学习如何提升对动力学特性发生改变的未见环境的零样本适应能力?
- RQ3基于选择最佳性能预测头的自适应规划,是否能提升样本效率与最终性能?
- RQ4该方法对超参数选择(如头数或规划时域)的鲁棒性如何?
- RQ5与标准多头或集成方法相比,轨迹级“最优解”损失的学习是否带来更好的泛化性能?
主要发现
- 在CrippledAnt环境中,T-MCL的平均回报比CaDM高出3.5倍,证明了其在零样本泛化方面的最先进性能。
- 移除上下文学习导致性能急剧下降,证实其在实现对未见动力学的在线适应中起着关键作用。
- 通过t-SNE可视化上下文嵌入,确认环境按动力学类型成功聚类,表明模型具备有效的表征学习能力。
- 当H=3个预测头时,性能达到峰值,表明在HalfCheetah环境中,三个头已足够捕捉多模态特性。
- 该方法对轨迹级损失时域(M)和自适应规划时域(N)的变化具有鲁棒性,且随着时域增加,性能持续提升。
- 即使不使用上下文学习,T-MCL仍优于PETS及其他基线方法,凸显其轨迹级学习机制的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。