Skip to main content
QUICK REVIEW

[论文解读] Meta-Learning surrogate models for sequential decision making

Alexandre Galashov, Jonathan Schwarz|arXiv (Cornell University)|Mar 28, 2019
Adversarial Robustness in Machine Learning参考文献 70被引用 10
一句话总结

该论文提出了一种用于顺序决策的元学习代理模型框架,利用概率模型——特别是神经过程(Neural Processes)——实现在相关任务间的数据高效、不确定性感知的适应。通过在任务分布上进行预训练,该模型在贝叶斯优化、上下文Bandits和强化学习中实现了快速、可泛化的优化,相较于基线方法仅需极少微调,并能提供校准的不确定性估计。

ABSTRACT

We introduce a unified probabilistic framework for solving sequential decision making problems ranging from Bayesian optimisation to contextual bandits and reinforcement learning. This is accomplished by a probabilistic model-based approach that explains observed data while capturing predictive uncertainty during the decision making process. Crucially, this probabilistic model is chosen to be a Meta-Learning system that allows learning from a distribution of related problems, allowing data efficient adaptation to a target task. As a suitable instantiation of this framework, we explore the use of Neural processes due to statistical and computational desiderata. We apply our framework to a broad range of problem domains, such as control problems, recommender systems and adversarial attacks on RL agents, demonstrating an efficient and general black-box learning approach.

研究动机与目标

  • 为解决当前顺序决策算法的数据效率低下问题,这些算法所需的经验量比人类高出数个数量级。
  • 将贝叶斯优化、上下文Bandits和强化学习等不同顺序决策问题统一于单一概率元学习框架下。
  • 通过从相关问题分布中学习数据驱动的先验,实现对新任务的快速适应。
  • 通过引入校准的预测不确定性,实现决策中探索与利用的平衡。
  • 在机器人控制、推荐系统以及强化学习智能体的对抗攻击等多样化领域中,展示泛化能力和效率。

提出的方法

  • 该框架使用概率元学习模型,特别是神经过程,从相关任务分布中学习函数的先验,从而在仅有少量观测的情况下实现对新任务的快速适应。
  • 模型在一组相关任务的数据集上进行训练,每个任务由上下文点 (x, y) 对组成,学习预测函数的后验分布。
  • 在决策过程中,采用Thompson采样从模型的预测分布中采样以选择下一步动作,从而平衡探索与利用。
  • 通过少量观测函数评估对代理模型进行微调,利用预学习的先验提升样本效率。
  • 通过将目标函数视为需推断的隐函数,支持黑箱优化,不确定性通过模型的预测方差进行量化。
  • 使用神经过程代理进行贝叶斯优化执行超参数搜索,性能通过归一化后的缩放最小奖励指标进行评估,以实现不同迷宫和智能体之间的可比性。

实验结果

研究问题

  • RQ1与标准基线相比,元学习代理模型是否能显著降低顺序决策任务中的样本复杂度?
  • RQ2单一元学习模型在机器人控制、推荐系统和对抗性强化学习攻击等多样化任务上的泛化能力如何?
  • RQ3通过概率元学习模型引入校准的不确定性,在贝叶斯优化和Bandit问题中对探索与收敛的改善程度如何?
  • RQ4与其它模型(如GP、DKL、BBB)相比,基于神经过程的代理模型在样本效率和不确定性校准方面的性能表现如何?
  • RQ5该框架是否能有效应用于复杂、高维的决策问题,如迷宫导航和全状态强化学习策略搜索?

主要发现

  • 元学习的神经过程代理在贝叶斯优化任务中达到了最先进性能,显著优于GP、DKL和BBB等基线方法,在收敛速度和样本效率方面表现更优。
  • 在位置搜索任务中,与标准基线相比,该模型将达到最优性能所需的评估次数减少了最多50%,在200个迷宫中平均缩放最小奖励达到0.92。
  • 在全搜索问题中,该模型在100次随机模拟中实现了0.88的平均缩放最小奖励,表明其在复杂、高维状态空间中具有强大的泛化能力。
  • 该框架在多样化领域中表现出稳健性能,包括对强化学习智能体的对抗攻击以及异构机械臂的控制,显示出广泛适用性。
  • 使用神经过程实现了有效的不确定性校准,相比非概率或非元学习模型,带来了更好的探索效果和更快的收敛速度。
  • 通过代理模型进行超参数调优,将所需评估次数减少了3至5倍,相较于随机搜索或网格搜索,验证了其在优化中的高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。