Skip to main content
QUICK REVIEW

[论文解读] Robot Representation and Reasoning with Knowledge from Reinforcement Learning

Keting Lu, Shiqi Zhang|arXiv (Cornell University)|Sep 28, 2018
Reinforcement Learning in Robotics被引用 6
一句话总结

该论文提出了一种新颖的KRR-RL框架,将逻辑-概率知识表示与基于模型的强化学习相结合,使机器人能够通过整合人类提供的陈述性知识和RL学习的转移概率,动态构建特定任务的规划模型。该方法在新型环境条件下显著提升了导航和递送任务的成功率,达到83.8%,而基线方法仅为26.8%。

ABSTRACT

Reinforcement learning (RL) agents aim at learning by interacting with an environment, and are not designed for representing or reasoning with declarative knowledge. Knowledge representation and reasoning (KRR) paradigms are strong in declarative KRR tasks, but are ill-equipped to learn from such experiences. In this work, we integrate logical-probabilistic KRR with model-based RL, enabling agents to simultaneously reason with declarative knowledge and learn from interaction experiences. The knowledge from humans and RL is unified and used for dynamically computing task-specific planning models under potentially new environments. Experiments were conducted using a mobile robot working on dialog, navigation, and delivery tasks. Results show significant improvements, in comparison to existing model-based RL methods.

研究动机与目标

  • 解决强化学习智能体在利用人类专家提供的陈述性知识方面的局限性。
  • 克服传统KRR系统无法从现实世界交互经验中学习的缺陷。
  • 使机器人能够在运行时,结合人类知识和RL学习的世界动态,动态构建高效、特定任务的规划模型。
  • 通过融合来自多个环境设置的知识,支持在新环境或未见环境条件下的鲁棒推理。
  • 在涉及导航、对话和递送的真实移动机器人任务中,验证该框架的有效性。

提出的方法

  • 使用P-log这一逻辑-概率KRR语言,以声明性形式表示和推理人类提供的规则以及RL学习的转移概率。
  • 采用基于模型的强化学习,从交互经验中学习概率转移模型。
  • 将学习到的转移概率集成到KRR模块中,实现在运行时动态生成部分世界模型。
  • 通过结合人类知识和RL学习的动力学,构建特定任务的规划模型,从而实现高效的策略计算。
  • 通过在人机交互过程中维护并更新多维(如物品、人员、位置)信念状态,支持不确定性下的推理。
  • 通过将多个学习环境设置(如上午与正午)的知识合并为统一的转移系统,实现对未见过环境设置的泛化。

实验结果

研究问题

  • RQ1逻辑-概率KRR能否与基于模型的RL有效结合,使机器人能够同时利用人类知识和学习到的动力学进行推理?
  • RQ2机器人如何利用统一的人类与RL衍生知识库,在运行时动态生成特定任务的规划模型?
  • RQ3该框架在多大程度上能够泛化到新环境或此前未见过的环境条件(例如未知的白天时间)?
  • RQ4KRR与基于模型的RL的集成是否能提升在涉及导航和人机交互的真实机器人任务中的性能?
  • RQ5通过利用先验知识和概率推理,该框架能否减少对冗余或高风险行为(如重复确认)的依赖?

主要发现

  • KRR-RL框架使机器人能够以前瞻性、声明性逻辑-概率形式,表示和推理通过基于模型的RL学习到的概率世界动态。
  • 人类知识与RL学习动力学的融合,实现了在运行时动态构建高效、特定任务规划模型的能力。
  • 在一项新型环境泛化任务中,KRR-RL智能体在导航任务中实现了83.8%的成功率,显著优于基线智能体的26.8%成功率。
  • 机器人通过利用先验知识成功减少了不必要的交互——例如,在基于学习到的动力学和上下文高度确定时,无需重复确认递送位置。
  • 在人机对话过程中,物品、人员、房间等多维信念状态被准确更新,展示了在不确定性下的鲁棒推理能力。
  • 即使机器人对环境条件(如白天时间)存在不确定性,该框架也能通过融合多个学习环境的知识,实现有效策略生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。