[论文解读] Synthesized Policies for Transfer and Adaptation across Tasks and Environments
本文提出合成策略(SynPo),一种通过元规则学习环境与任务解耦嵌入的方法,以组合可迁移策略。仅在40%的(环境,任务)组合上进行训练,SynPo在网格世界中对未见过的组合实现了96.16%的平均成功率,在THOR中对未见过的组合实现了35.4%的成功率,优于基线方法在泛化与适应性方面的表现。
The ability to transfer in reinforcement learning is key towards building an agent of general artificial intelligence. In this paper, we consider the problem of learning to simultaneously transfer across both environments (ENV) and tasks (TASK), probably more importantly, by learning from only sparse (ENV, TASK) pairs out of all the possible combinations. We propose a novel compositional neural network architecture which depicts a meta rule for composing policies from the environment and task embeddings. Notably, one of the main challenges is to learn the embeddings jointly with the meta rule. We further propose new training methods to disentangle the embeddings, making them both distinctive signatures of the environments and tasks and effective building blocks for composing the policies. Experiments on GridWorld and Thor, of which the agent takes as input an egocentric view, show that our approach gives rise to high success rates on all the (ENV, TASK) pairs after learning from only 40% of them.
研究动机与目标
- 在未见过的环境和任务之间实现强化学习中的高效迁移与适应。
- 解决从稀疏(环境,任务)组合数据中学习有效策略的挑战。
- 联合学习环境与任务的解耦嵌入,作为策略组合的有效构建模块。
- 通过强制分离任务与环境表征,提升迁移学习中的泛化能力并减少过拟合。
- 通过仅学习新嵌入而保持策略基础不变,实现在新环境或任务中的少样本适应。
提出的方法
- 提出一种组合式神经网络架构,利用学习到的策略基函数的线性组合,从环境与任务嵌入中合成策略。
- 通过解耦目标联合训练策略基函数与嵌入,确保环境与任务嵌入具有区分性且适用于策略组合。
- 模型从稀疏的(环境,任务)组合中学习,推理时策略基函数保持固定。
- 元规则将策略作为环境与任务嵌入的函数进行组合,实现对新组合的零样本迁移。
- 该方法使用PPO对新环境或任务进行微调,仅需极少数据,利用固定的策略基函数与新推断的嵌入。
- 通过一种新颖的目标函数强制实现解耦,以鼓励环境与任务的区分性、低维表征。
实验结果
研究问题
- RQ1仅使用稀疏(环境,任务)组合数据,单一策略组合机制是否能同时在未见过的环境和任务上实现泛化?
- RQ2解耦表征学习在提升强化学习中策略迁移与适应性方面的有效性如何?
- RQ3固定策略基函数与学习到的嵌入相结合,是否能以最少的微调数据在未见过的(环境,任务)组合上实现高性能?
- RQ4在复杂环境中,该方法与现有多任务学习与迁移学习基线相比性能如何?
- RQ5在未见过的迁移场景中,增量学习嵌入(如仅学习任务或仅学习环境)是否优于联合学习?
主要发现
- SynPo在仅使用40%组合进行训练后,于网格世界中对未见过的(环境,任务)组合实现了96.16%的平均成功率,显著优于MLP、MTL与ModuleNet。
- 在照片级真实感的THOR模拟器中,SynPo在未见过的组合上实现了35.4%的成功率,优于所有基线方法,包括ModuleNet(14.4%)、MLP(25.8%)与MTL(33.3%)。
- 消融研究证实,环境与任务嵌入的解耦对有效策略合成与泛化至关重要。
- 在仅增量学习任务或环境嵌入的迁移设置2中,性能优于同时学习两者的设置3,表明顺序适应更有效。
- 所有方法在PPO微调后性能均有所提升,但SynPo保持了最高的性能增益,体现出其鲁棒性与可扩展性。
- 对策略性能在任务与环境间分布的可视化显示,跨任务迁移比跨环境迁移更容易,与人类学习模式一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。