Skip to main content
QUICK REVIEW

[论文解读] Meta Reinforcement Learning with Task Embedding and Shared Policy

Lin Lan, Zhenguo Li|arXiv (Cornell University)|May 16, 2019
Reinforcement Learning in Robotics参考文献 29被引用 9
一句话总结

本文提出 TESP,一种元强化学习方法,通过元学习的任务编码器显式建模任务个体性,通过共享策略显式建模任务共性。通过使用可学习的SGD优化器微调任务编码器,并将单一策略基于任务嵌入进行条件化,TESP 在训练任务和分布外的新任务上均实现了比基线方法高3–4倍的回报,展现出更优的数据效率和泛化能力。

ABSTRACT

Despite significant progress, deep reinforcement learning (RL) suffers from data-inefficiency and limited generalization. Recent efforts apply meta-learning to learn a meta-learner from a set of RL tasks such that a novel but related task could be solved quickly. Though specific in some ways, different tasks in meta-RL are generally similar at a high level. However, most meta-RL methods do not explicitly and adequately model the specific and shared information among different tasks, which limits their ability to learn training tasks and to generalize to novel tasks. In this paper, we propose to capture the shared information on the one hand and meta-learn how to quickly abstract the specific information about a task on the other hand. Methodologically, we train an SGD meta-learner to quickly optimize a task encoder for each task, which generates a task embedding based on past experience. Meanwhile, we learn a policy which is shared across all tasks and conditioned on task embeddings. Empirical results on four simulated tasks demonstrate that our method has better learning capacity on both training and novel tasks and attains up to 3 to 4 times higher returns compared to baselines.

研究动机与目标

  • 解决现有元强化学习方法在显式建模任务个体性(特异性)和共性(共享结构)方面的局限性。
  • 通过将任务特定适应与共享策略学习解耦,提升元强化学习中的数据效率和泛化能力。
  • 通过学习一个能从过往经验生成任务嵌入的任务编码器,实现对新任务的快速适应。
  • 通过使用共享参数在多样化任务分布上训练策略,提升对分布偏移的鲁棒性。

提出的方法

  • 引入一个任务编码器网络,从存储在任务缓冲区中的过往经验生成潜在任务嵌入。
  • 训练一个可学习的SGD优化器作为元学习器,基于每项任务的经验快速适应其任务编码器。
  • 在所有任务中使用单一共享策略,该策略基于观测和任务嵌入生成动作。
  • 通过元更新优化元学习器,损失函数旨在促进任务编码器的快速适应和高累计回报。
  • 在元学习器的优化器中应用自适应的逐参数学习率,以提升收敛性和稳定性。
  • 通过正则化项对任务编码器的适应过程进行正则化,以防止过拟合并提升泛化能力。

实验结果

研究问题

  • RQ1通过元学习的任务编码器显式建模任务个体性,是否能提升元强化学习在训练任务和新任务上的性能?
  • RQ2将任务特定适应(通过任务编码器)与共享策略学习分离,对分布外任务的泛化能力有何影响?
  • RQ3使用基于任务嵌入的共享策略,是否能实现比任务特定策略更优的数据效率和更快的适应速度?
  • RQ4与使用全部经验相比,利用过往经验的缓冲区在多大程度上提升了任务嵌入的质量?
  • RQ5元优化过程中自适应学习率和正则化对性能和稳定性有何影响?

主要发现

  • TESP 在训练任务和新任务上的累计回报最高可达基线方法的3–4倍,展现出更优的学习能力。
  • 在分布外任务(D'')上,TESP 保持强劲性能,而基线方法出现过拟合并显著退化,表明泛化能力得到提升。
  • 与基线方法相比,TESP 在训练任务与分布外任务之间的性能差距更小,表明其鲁棒性更强。
  • 消融实验表明,共享策略和正则化项对泛化能力至关重要,尤其在未见任务分布上表现显著。
  • 使用具有自适应学习率的元学习SGD优化器,带来更稳定的收敛和更低的随机种子间方差。
  • 移除任务缓冲区或使用全部经验(而非前M个最佳经验)会降低性能,表明选择性经验对任务嵌入学习至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。