[论文解读] Meta-Reinforcement Learning in Broad and Non-Parametric Environments
该论文提出TIGR,一种元强化学习算法,通过使用高斯变分自编码器(VAE)进行任务推理,以及门控循环单元(GRUs)建模任务动态,实现对非参数化和非平稳任务的零样本适应。在具有动态任务切换的非参数化环境中,其样本效率比最先进方法快3–10倍,且渐近性能更优。
Recent state-of-the-art artificial agents lack the ability to adapt rapidly to new tasks, as they are trained exclusively for specific objectives and require massive amounts of interaction to learn new skills. Meta-reinforcement learning (meta-RL) addresses this challenge by leveraging knowledge learned from training tasks to perform well in previously unseen tasks. However, current meta-RL approaches limit themselves to narrow parametric task distributions, ignoring qualitative differences between tasks that occur in the real world. In this paper, we introduce TIGR, a Task-Inference-based meta-RL algorithm using Gaussian mixture models (GMM) and gated Recurrent units, designed for tasks in non-parametric environments. We employ a generative model involving a GMM to capture the multi-modality of the tasks. We decouple the policy training from the task-inference learning and efficiently train the inference mechanism on the basis of an unsupervised reconstruction objective. We provide a benchmark with qualitatively distinct tasks based on the half-cheetah environment and demonstrate the superior performance of TIGR compared to state-of-the-art meta-RL approaches in terms of sample efficiency (3-10 times faster), asymptotic performance, and applicability in non-parametric environments with zero-shot adaptation.
研究动机与目标
- 解决现有元强化学习方法假设任务分布狭窄、参数化且平稳的局限性。
- 实现在无需任务特定微调的情况下,对运行前进、后退或跳跃等定性不同的非参数化任务的快速适应。
- 支持在推理过程中而非仅在测试时发生的非平稳任务变化的零样本适应。
- 将无模型、离策略强化学习与无监督任务推理相结合,以提升数据效率和泛化能力。
- 在半鼠鼠(half-cheetah)和蚂蚁(ant)等机器人控制环境中,建立非参数化任务泛化的基准。
提出的方法
- TIGR使用高斯变分自编码器(VAE)显式建模多模态任务分布,捕捉任务之间的定性差异。
- 通过在重构的MDP上使用无监督重建目标进行预训练,将任务推理与策略训练解耦。
- 使用门控循环单元(GRU)处理最近的转移历史,实现实时任务身份推理,支持对非平稳任务变化的动态适应。
- 策略使用SAC(软演员评论家)进行离策略训练,结合通过VAE和GRU推断出的任务条件潜在代码。
- 在每个时间步使用最近转移历史的特征进行任务推理,实现对新任务模式的即时适应。
- 该方法采用包含8个聚类的多组分VAE,以表示不同任务类型,例如半鼠鼠环境中的不同运动目标。
实验结果
研究问题
- RQ1元强化学习智能体能否泛化到定性不同的非参数化任务,如前进跑与后退跑、跳跃与转向?
- RQ2智能体能否在无需重训练的情况下,实现对推理过程中发生的非平稳任务变化的零样本适应?
- RQ3与高斯任务嵌入方法相比,使用基于VAE的生成模型进行任务推理是否能提升样本效率和渐近性能?
- RQ4在具有高非参数化变异性的环境中,TIGR相较于最先进元强化学习基线方法表现如何?
- RQ5在元训练期间对MDP进行无监督重建,能否有效支持复杂且多样的任务分布中的下游策略学习?
主要发现
- 在非参数化环境中,TIGR的样本效率比最先进方法(如PEARL和MAML)快3–10倍。
- 该算法在非参数化任务上表现出显著提升的渐近性能,尤其在零样本适应场景中。
- TIGR在半鼠鼠环境中成功泛化到八种不同的非参数化任务,包括前进/后退跑、目标到达和翻滚。
- 使用多模态VAE可实现对定性不同行为的准确任务推理,即使任务变化在推理过程中动态发生。
- 基于最近转移历史实时进行GRU任务推理的零样本适应机制,使智能体无需重训练即可立即响应任务变化。
- 实证结果表明,TIGR在多个非参数化基准(包括修改后的半鼠鼠和蚂蚁环境)中,均在样本效率和最终性能上优于现有方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。