Skip to main content
QUICK REVIEW

[论文解读] Hypernetworks in Meta-Reinforcement Learning

Jacob Beck, Matthew Thomas Jackson|arXiv (Cornell University)|Oct 20, 2022
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出了一种新颖的超网络初始化方法——Bias-HyperInit,通过使超网络在任务间实现良好泛化,显著提升了元强化学习的性能,同时达到或超越了当前最先进结果。该方法优于朴素初始化和现有基于监督学习的初始化方案,在Pick-Place任务上成功率最高提升了9倍,并在VariBAD和RL2框架下于MuJoCo、Meta-World和网格世界基准测试中均实现了稳定提升。

ABSTRACT

Training a reinforcement learning (RL) agent on a real-world robotics task remains generally impractical due to sample inefficiency. Multi-task RL and meta-RL aim to improve sample efficiency by generalizing over a distribution of related tasks. However, doing so is difficult in practice: In multi-task RL, state of the art methods often fail to outperform a degenerate solution that simply learns each task separately. Hypernetworks are a promising path forward since they replicate the separate policies of the degenerate solution while also allowing for generalization across tasks, and are applicable to meta-RL. However, evidence from supervised learning suggests hypernetwork performance is highly sensitive to the initialization. In this paper, we 1) show that hypernetwork initialization is also a critical factor in meta-RL, and that naive initializations yield poor performance; 2) propose a novel hypernetwork initialization scheme that matches or exceeds the performance of a state-of-the-art approach proposed for supervised settings, as well as being simpler and more general; and 3) use this method to show that hypernetworks can improve performance in meta-RL by evaluating on multiple simulated robotics benchmarks.

研究动机与目标

  • 为解决元强化学习中超网络初始化的关键挑战,现有朴素方法无法保证可靠性能。
  • 提出一种通用且简单的初始化方法,其性能可匹配或超越监督学习设置下的最先进结果。
  • 证明当超网络被正确初始化时,可在多种模拟机器人环境中显著提升元强化学习智能体的性能。
  • 表明在总模型参数量受限的情况下,超网络在样本效率和泛化能力方面仍优于标准架构。

提出的方法

  • 提出Bias-HyperInit,一种新颖的超网络初始化方案,使超网络能够生成与目标初始化分布匹配的主网络权重。
  • 引入Weight-HyperInit作为补充方法,直接初始化超网络权重,使其生成的主网络权重匹配目标分布。
  • 通过将超网络条件化于任务编码器生成的任务嵌入,将超网络应用于元强化学习,实现在推理阶段无需任务ID即可生成特定任务策略。
  • 采用标准元强化学习训练范式,结合策略梯度更新,其中超网络在每个时间步动态生成策略网络的参数。
  • 采用可微分架构,使超网络输出用于更新主策略网络的参数,支持端到端训练。
  • 在Meta-World、MuJoCo和网格世界等标准元强化学习基准上评估该方法,以VariBAD和RL2作为基线模型。

实验结果

研究问题

  • RQ1超网络初始化是否显著影响元强化学习性能?朴素初始化方案是否失效?
  • RQ2能否设计一种通用的超网络初始化方法,在无需架构或分布特异性推导的前提下,达到或超越监督学习设置下的最先进性能?
  • RQ3在多样化元强化学习基准上,采用所提初始化方法的超网络是否能优于标准架构和现有方法?
  • RQ4超网络的性能增益是否随模型规模增大而提升?在总参数量受限时,其是否仍优于标准架构?

主要发现

  • 在Pick-Place任务上,Bias-HyperInit实现了34.2%的成功率,相比标准架构的3.8%提升了9倍,且优于HFI方法(25.5%)。
  • 在ML10基准上,采用Bias-HyperInit的超网络使成功率相比标准架构提升2倍,且优于HFI方法。
  • 在Cheetah-Dir和Walker任务上,采用Bias-HyperInit的超网络在所有主网络尺寸和总参数量下均匹配或超越标准架构,尤其在大模型规模下优势更明显。
  • 该方法在VariBAD和RL2上均提升了性能,尤其在RL2框架下,ML10任务的成功率提升了2倍。
  • Bias-HyperInit在所有评估基准(包括FiLM和标准架构)上均达到或超越HFI性能,同时更加简洁且更具通用性。
  • 即使在总参数量保持不变的条件下,采用Bias-HyperInit的超网络也始终优于标准架构,证明其具有更优的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。