[论文解读] Meta-learning curiosity algorithms
本文提出了一种新颖的元学习方法,通过在包含神经网络、缓冲区和自定义损失函数的丰富程序化好奇心算法空间中进行搜索,而非迁移神经网络权重。该方法发现了两种新型好奇心算法,在基于图像的网格世界、Ant、Hopper和Lunar Lander等多样化环境中,其性能优于或匹配人类设计的方法,展示了元强化学习在跨不同任务上的广泛泛化能力。
We hypothesize that curiosity is a mechanism found by evolution that encourages meaningful exploration early in an agent's life in order to expose it to experiences that enable it to obtain high rewards over the course of its lifetime. We formulate the problem of generating curious behavior as one of meta-learning: an outer loop will search over a space of curiosity mechanisms that dynamically adapt the agent's reward signal, and an inner loop will perform standard reinforcement learning using the adapted reward signal. However, current meta-RL methods based on transferring neural network weights have only generalized between very similar tasks. To broaden the generalization, we instead propose to meta-learn algorithms: pieces of code similar to those designed by humans in ML papers. Our rich language of programs combines neural networks with other building blocks such as buffers, nearest-neighbor modules and custom loss functions. We demonstrate the effectiveness of the approach empirically, finding two novel curiosity algorithms that perform on par or better than human-designed published curiosity algorithms in domains as disparate as grid navigation with image inputs, acrobot, lunar lander, ant and hopper.
研究动机与目标
- 为解决当前元强化学习方法在差异显著的环境中泛化能力差的局限性,通过将好奇心形式化为对算法空间的元学习。
- 通过学习完整程序而非仅网络权重,实现在不同状态空间和动作空间(如基于图像和机器人控制任务)的环境间泛化。
- 通过在包含神经网络、最近邻模块和自定义损失函数等程序组件的组合空间中进行自动搜索,发现新颖且高效的好奇心机制。
- 通过基于程序结构的性能预测和早期停止策略,尽早剔除无希望的程序,使计算成本较高的元学习过程更加高效。
- 证明元学习生成的程序可产生性能匹配或超越人类设计基线的 curiosity 算法,适用于多样化且复杂的环境。
提出的方法
- 该方法采用双循环框架:外层循环在程序的领域特定语言(DSL)上执行进化搜索,以生成好奇心模块;内层循环则使用动态调整的奖励信号运行标准强化学习。
- DSL 支持复杂的程序结构,包括使用梯度下降的神经网络、学习到的目标函数、集成模型、缓冲区和自定义损失函数,从而能够表示多样化的探索策略。
- 搜索过程基于学习曲线监测和程序结构的性能预测实施早期停止,避免对无希望候选程序进行完整训练。
- 该方法在环境分布上评估候选程序,从更简单、短时程的任务开始,以尽早剔除无效算法。
- 最终的 curiosity 模块在每个时间步计算一个伪奖励 $\widehat{r}$,用于塑造智能体的内在动机并引导探索。
- 该方法通过使用可多态的数据类型,根据环境自动调整网络架构(如 CNN 与 MLP),从而在不同输入模态(如像素与关节状态)的环境中实现泛化。
实验结果
研究问题
- RQ1在状态空间和动作空间截然不同的环境中,对丰富程序化好奇心算法空间进行元学习,是否能实现泛化?
- RQ2通过自动搜索发现的 curiosity 算法是否能在多样化强化学习基准中表现优于或匹配人类设计的内在奖励机制?
- RQ3基于结构预测和学习曲线监测的早期剪枝是否能显著降低在组合程序空间中元强化学习的计算成本?
- RQ4包含神经网络、缓冲区和自定义损失函数的元学习程序是否能发现文献中尚未提出的新颖且有效的探索策略?
- RQ5与元学习权重相比,元学习程序在跨根本不同的任务中泛化能力如何?
主要发现
- 所提出的方法发现了两种新颖的好奇心算法,在包括基于图像的网格导航、Acrobot、Lunar Lander、Ant 和 Hopper 在内的多样化环境中,其性能与人类设计的好奇心算法相当或更优。
- 表现最佳的好奇心算法在不同输入空间(如像素与关节角度)和输出空间的环境中均表现出泛化能力,展示了超越相似任务的广泛迁移能力。
- 该方法在标准 curiosity 方法难以奏效的环境中实现了有效的探索并获得了高回报,尤其在长时程、高变化性的设置中表现突出。
- 基于性能预测和学习曲线监测的早期剪枝策略显著减少了计算时间,避免了对无希望程序的完整训练。
- 该方法超越了以往仅在小范围任务变化(如不同迷宫或斜坡)中泛化的元强化学习方法,实现了在根本不同的环境间的泛化。
- 所发现的算法具有可解释性,并由模块化组件(如神经网络、最近邻模块)构成,表明其具有进一步分析和适配的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。