Skip to main content
QUICK REVIEW

[论文解读] Programmable Agents

Misha Denil, Sergio Gómez Colmenarejo|arXiv (Cornell University)|Jun 20, 2017
Topic Modeling参考文献 23被引用 4
一句话总结

本文提出了可编程智能体——一种通过端到端训练将符号与环境属性进行关联的深度强化学习智能体,能够以形式化语言执行声明式程序。该智能体在已知与未知对象属性的新组合上实现了近乎完美的零样本泛化,优于标准架构在涉及未见形状、颜色和干扰物的任务上的表现。

ABSTRACT

We build deep RL agents that execute declarative programs expressed in formal language. The agents learn to ground the terms in this language in their environment, and can generalize their behavior at test time to execute new programs that refer to objects that were not referenced during training. The agents develop disentangled interpretable representations that allow them to generalize to a wide variety of zero-shot semantic tasks.

研究动机与目标

  • 开发能够基于环境观测以形式化语言执行声明式程序的智能体。
  • 实现对训练期间未见过的新对象属性及其组合的零样本泛化。
  • 在切换任务分布时,确保对灾难性遗忘的鲁棒性。
  • 创建可解释的、解耦的表征,通过激活图显式映射到程序术语。
  • 仅使用基于环境的奖励信号进行端到端训练,无需辅助监督或控制任务。

提出的方法

  • 智能体采用一种新颖的'可编程网络'架构,通过结构化瓶颈强制学习解耦的、组合式的对象属性表征。
  • 每个程序通过可微的、与程序特定的架构执行,该架构将固定的一组环境对象属性(如颜色、形状)进行映射。
  • 智能体通过基于CNN的特征提取器观察环境,并生成显式表示程序术语与对象关联的激活图。
  • 使用来自验证器的奖励信号,通过端到端强化学习进行训练,验证器基于真实状态信息检查程序是否满足。
  • 系统采用一种搜索过程(即智能体),根据观测结果作用于环境,以实现程序目标。
  • 通过学习区分并组合独立属性(如颜色与形状),实现通过排除法进行推理(如'不是红色')或新组合的泛化。

实验结果

研究问题

  • RQ1深度强化学习智能体是否能在无属性分配监督的情况下,学习将声明式程序术语与视觉环境中的属性关联?
  • RQ2智能体在涉及已知与未知对象属性新组合的零样本任务中,其泛化能力在多大程度上成立?
  • RQ3智能体在微调新任务(未见过)后,是否仍能保持原始任务的性能,避免灾难性遗忘?
  • RQ4可解释的、解耦的表征是否能从原始观测和程序执行中端到端地涌现?
  • RQ5在强化学习中,声明式编程范式是否能比指令式或函数式程序执行带来更强的组合性与泛化能力?

主要发现

  • 可编程智能体在三维设计任务中,对所有泛化条件均实现了近乎完美的零样本性能,包括涉及新形状、新颜色以及两者新组合的任务。
  • 相比之下,标准深度强化学习架构在相同的3x3环境中完全失败,表现不优于随机基线。
  • 该智能体成功泛化到不同数量积木(最多10个)的任务,并能忽略具有新属性的干扰积木。
  • 该智能体表现出对灾难性遗忘的鲁棒性:即使在新任务上进行了250万步的微调后,原始任务的性能仍保持稳定。
  • 激活图的可视化证实,智能体学习到了程序术语与对象属性之间的显式、可解释的映射。
  • 该方法通过排除法实现了对新属性的泛化(如'不是红色的对象'),即使此类引用在训练中从未出现过。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。