Skip to main content
QUICK REVIEW

[论文解读] Neuro-algorithmic Policies enable Fast Combinatorial Generalization

Marin Vlastelica, Michal Rolínek|arXiv (Cornell University)|Feb 15, 2021
Machine Learning and Algorithms参考文献 3被引用 4
一句话总结

本文提出神经-算法策略(NAP),一种将深度神经网络与可微分时变最短路径(TDSP)求解器相结合的混合架构,以在强化学习中实现快速组合泛化。通过黑箱反向传播的端到端训练,NAP在远少于标准模仿学习基线方法所需专家示范的情况下,实现了对未见过的环境变化的强零样本泛化能力。

ABSTRACT

Although model-based and model-free approaches to learning the control of systems have achieved impressive results on standard benchmarks, generalization to task variations is still lacking. Recent results suggest that generalization for standard architectures improves only after obtaining exhaustive amounts of data. We give evidence that generalization capabilities are in many cases bottlenecked by the inability to generalize on the combinatorial aspects of the problem. Furthermore, we show that for a certain subclass of the MDP framework, this can be alleviated by neuro-algorithmic architectures. Many control problems require long-term planning that is hard to solve generically with neural networks alone. We introduce a neuro-algorithmic policy architecture consisting of a neural network and an embedded time-dependent shortest path solver. These policies can be trained end-to-end by blackbox differentiation. We show that this type of architecture generalizes well to unseen variations in the environment already after seeing a few examples.

研究动机与目标

  • 解决标准深度强化学习与模仿学习方法在面对未见过的环境变化时泛化能力差的问题。
  • 探究将最短路径求解器等组合算法嵌入神经策略是否能提升低数据场景下的泛化能力。
  • 证明神经-算法架构可通过将组合复杂度转移至高效算法,实现强大的泛化能力。
  • 评估可微分规划器在动态、基于图像的控制环境中的有效性。

提出的方法

  • 该方法使用深度神经网络从输入观测生成随时间演化的图,其中边权表示时变成本。
  • 可微分时变最短路径(TDSP)求解器在潜在图上计算最优轨迹,梯度通过黑箱反向传播。
  • 整个架构通过少量专家轨迹的模仿学习进行端到端训练。
  • 潜在图结构假设已知的拓扑网格与固定动作,求解器基于网络生成的演化成本运行。
  • 该方法利用最短路径算法的组合归纳偏置,提升泛化能力,而无需显式建模学习。
  • 该方法被应用于静态与动态环境,包括基于图像的游戏环境。

实验结果

研究问题

  • RQ1将可微分最短路径求解器嵌入神经策略是否能提升对未见过的环境变化的泛化能力?
  • RQ2在低数据场景下,神经-算法策略相较于标准模仿学习基线方法的性能如何?
  • RQ3使用组合规划器是否能在泛化设置中带来更优(更短)的轨迹?
  • RQ4该方法在动态环境中对规划时域长度的敏感性如何?
  • RQ5在仅需极少专家示范的情况下,神经-算法策略能否在基于图像的控制任务中实现有效泛化?

主要发现

  • 在Maze环境中,NAP仅用100个训练关卡即达到近80%的成功率,而PPO和DrAC即使训练1,000个关卡也未能达到该水平。
  • 在Maze环境中,NAP在1,000个关卡上训练的性能,与PPO在200,000个关卡上训练的性能相当。
  • 在Crash Jewel Hunt 5×5环境中,NAP仅用30条专家轨迹即成功解决33%的1,000个测试关卡,而行为克隆基线方法解决的关卡不足5%。
  • 即使在已解决的关卡上,NAP的路径长度也显著短于PPO和DrAC∗,表明其路径更优。
  • 在动态环境中,更长的规划时域提升了性能,但在静态环境(如Maze)中无此优势,符合预期。
  • 该方法在极小数据下仍表现出强大泛化能力,表明规划器提供的组合归纳偏置是低数据泛化的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。