Skip to main content
QUICK REVIEW

[论文解读] Injecting Prior Knowledge for Transfer Learning into Reinforcement Learning Algorithms using Logic Tensor Networks

Samy Badreddine, Michael Spranger|arXiv (Cornell University)|Jun 15, 2019
Reinforcement Learning in Robotics参考文献 15被引用 8
一句话总结

本文提出将基于深度神经网络的的一阶逻辑先验——通过逻辑张量网络(LTN)实现——整合到深度强化学习(DRL)智能体中,以实现更快、更具迁移性的学习。通过联合处理原始图像输入与符号事实(例如,物体类型、语义角色),智能体能够动态利用先验知识,显著减少在场景变化下的重训练需求,并提升泛化能力,尤其当先验包含关于物体语义的推导事实时效果更显著。

ABSTRACT

Human ability at solving complex tasks is helped by priors on object and event semantics of their environment. This paper investigates the use of similar prior knowledge for transfer learning in Reinforcement Learning agents. In particular, the paper proposes to use a first-order-logic language grounded in deep neural networks to represent facts about objects and their semantics in the real world. Facts are provided as background knowledge a priori to learning a policy for how to act in the world. The priors are injected with the conventional input in a single agent architecture. As proof-of-concept, the paper tests the system in simple experiments that show the importance of symbolic abstraction and flexible fact derivation. The paper shows that the proposed system can learn to take advantage of both the symbolic layer and the image layer in a single decision selection module.

研究动机与目标

  • 通过整合人类提供的符号先验,提升深度强化学习中的样本效率与迁移学习能力。
  • 探究将一阶逻辑事实嵌入神经网络如何提升策略在任务与环境变化下的泛化能力。
  • 证明符号抽象与灵活的事实推导可与感知在单一决策模块中联合学习。
  • 评估先验知识——尤其是推导事实——对变化环境中探索与学习稳定性的影响。
  • 探索探索超参数(例如,ε)在知识注入型强化学习系统中的作用。

提出的方法

  • 使用逻辑张量网络(LTN)在深度神经网络中表示并嵌入一阶逻辑事实(例如,'x 是敌人','y 是钥匙')。
  • 将符号先验直接集成到DRL智能体的输入流中,实现从像素与符号事实的联合学习。
  • 采用可微分逻辑框架,使符号知识能够影响策略学习,实现端到端训练。
  • 在具有不同物体颜色与语义角色的网格世界环境中,应用基于DQN的智能体测试迁移能力。
  • 同时使用物体类型先验与语义事实先验(例如,'敌人应被避开')来评估知识利用效果。
  • 在有无ε-探索重置的情况下训练智能体,以评估探索策略对知识迁移的影响。

实验结果

研究问题

  • RQ1基于神经网络嵌入的符号先验是否能提升DRL中的样本效率与迁移学习能力?
  • RQ2包含推导语义事实(例如,'敌人必须被避开')是否会影响在环境变化下的泛化能力?
  • RQ3在单一模块中整合符号与感知输入,是否能使智能体学会有选择地使用先验知识?
  • RQ4探索策略的选择(例如,ε-重置)与先验知识在迁移学习中的相互作用如何?
  • RQ5当任务语义改变时,智能体是否能学会依赖符号抽象而非原始像素模式?

主要发现

  • 符号先验的引入——尤其是语义事实——在场景变化期间显著减少了性能下降,表明迁移能力得到提升。
  • 同时具备物体类型与基于事实的先验的智能体学习速度更快,并在环境切换中保持更高性能,即使物体颜色发生变化。
  • 每次场景变化后的性能退化随时间减弱,表明智能体已学会利用符号知识进行泛化。
  • 对ε进行重置会损害知识注入型智能体的性能,表明当智能体已学会迁移知识时,应保留探索能力。
  • 仅依赖物体类型先验在物体语义改变时(例如,圆形在一种场景中是敌人,另一种场景中是可收集物)不足以应对,但基于事实的先验可实现稳健适应。
  • 该系统展现出动态知识选择能力,学会在有益时利用符号事实,而在符号线索模糊或具有误导性时依赖原始视觉信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。