Skip to main content
QUICK REVIEW

[论文解读] Learning Programmatically Structured Representations with Perceptor Gradients

Svetlin Penkov, Subramanian Ramamoorthy|arXiv (Cornell University)|May 2, 2019
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出了感知器梯度算法,通过将智能体策略分解为神经感知器网络(从原始观测中提取符号)和用户定义的任务编码程序(将符号映射到动作),实现符号表示的学习。该方法显著提升了可迁移、语义明确表示的学习速度与效率,已在小车-平衡杆和类似Minecraft的导航任务中,成功基于像素输入训练出LQR控制器和A*规划器。

ABSTRACT

We present the perceptor gradients algorithm -- a novel approach to learning symbolic representations based on the idea of decomposing an agent's policy into i) a perceptor network extracting symbols from raw observation data and ii) a task encoding program which maps the input symbols to output actions. We show that the proposed algorithm is able to learn representations that can be directly fed into a Linear-Quadratic Regulator (LQR) or a general purpose A* planner. Our experimental results confirm that the perceptor gradients algorithm is able to efficiently learn transferable symbolic representations as well as generate new observations according to a semantically meaningful specification.

研究动机与目标

  • 解决从原始、噪声观测中学习语义上对规划与控制有意义的符号表示的挑战。
  • 通过在表示学习中引入程序化归纳偏置,弥合数据驱动神经网络与符号推理之间的鸿沟。
  • 实现样本高效学习表示,使这些表示可直接用于下游规划器(如LQR或A*)。
  • 通过复用和微调预训练感知器,实现迁移学习与终身学习,避免灾难性遗忘。
  • 展示从符号规范生成真实观测的能力,实现语义数据增强。

提出的方法

  • 将策略分解为感知器网络(神经网络)和用户提供的任务编码程序,前者将原始观测映射到符号状态,后者将符号映射到动作。
  • 使用REINFORCE估计器与策略梯度训练感知器,其中奖励信号来自任务编码程序的性能。
  • 通过程序化正则化构建潜在空间,嵌入语义意义与任务程序的归纳偏置。
  • 同时应用前馈与自编码感知器,从像素输入中学习解耦、可解释的表示。
  • 通过堆叠多个感知器(如姿态与物体位置)并使用低学习率微调,实现迁移学习,防止灾难性遗忘。
  • 通过解码多个感知器的联合潜在空间,从符号规范生成合成观测,保持空间与语义一致性。

实验结果

研究问题

  • RQ1程序化任务描述能否作为有效的归纳偏置,提升从原始观测中学习符号表示的样本效率?
  • RQ2所提出的感知器梯度方法能否学习到与经典控制方法(如LQR)或规划算法(如A*)直接兼容的表示?
  • RQ3预训练的感知器在多大程度上可被迁移并适应新任务,而不会发生灾难性遗忘?
  • RQ4所学的符号表示能否用于从符号规范生成语义明确且逼真的观测?
  • RQ5与统计约束(如解耦性、独立性)相比,程序化正则化在提升表示质量与下游任务性能方面表现如何?

主要发现

  • 感知器梯度算法显著优于标准策略梯度方法,在3,000次迭代内即在‘收集木材’任务中达到最优性能。
  • 该方法成功从原始像素观测中学习到小车-平衡杆状态的符号表示,使线性二次调节器(LQR)能够实现有效控制。
  • 通过感知器梯度学习到的符号表示具有可迁移性:用于代理姿态的预训练感知器被成功复用于新导航与搜索任务并完成微调。
  • 堆叠感知器的联合潜在空间保留了语义结构,能够从符号规范生成真实、具备遮挡感知能力的图像。
  • 从符号输入生成的观测能以高保真度重建图像,仅在部分样本中观察到轻微的方向相关伪影。
  • 通过任务编码程序实现的程序化正则化提供了一般且有效的归纳偏置,提升了泛化能力,并实现了与符号规划器的直接集成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。