Skip to main content
QUICK REVIEW

[论文解读] Composable Action-Conditioned Predictors: Flexible Off-Policy Learning for Robot Navigation

Gregory Kahn, Adam Villaflor|arXiv (Cornell University)|Oct 16, 2018
Reinforcement Learning in Robotics参考文献 14被引用 10
一句话总结

本文提出可组合的动作条件预测器(CAPs),一种框架,通过使用视觉检测器作为自动标签,从离策略、自主收集的数据中学习预测多种事件线索(如碰撞、速度、车道位置和门口)。 通过在这些线索上训练动作条件预测模型,CAPs 实现了无需微调即可在推理时灵活、即时地组合任务,展示了在真实 RC 小车上成功完成多样化目标(如避碰、航向控制和接近门口)的导航能力。

ABSTRACT

A general-purpose intelligent robot must be able to learn autonomously and be able to accomplish multiple tasks in order to be deployed in the real world. However, standard reinforcement learning approaches learn separate task-specific policies and assume the reward function for each task is known a priori. We propose a framework that learns event cues from off-policy data, and can flexibly combine these event cues at test time to accomplish different tasks. These event cue labels are not assumed to be known a priori, but are instead labeled using learned models, such as computer vision detectors, and then `backed up' in time using an action-conditioned predictive model. We show that a simulated robotic car and a real-world RC car can gather data and train fully autonomously without any human-provided labels beyond those needed to train the detectors, and then at test-time be able to accomplish a variety of different tasks. Videos of the experiments and code can be found at https://github.com/gkahn13/CAPs

研究动机与目标

  • 实现通用机器人学习,而无需为每个任务预先定义、手工编码奖励函数。
  • 实现从机器人在真实或模拟环境中自主收集的离策略数据中进行自主学习,仅依赖检测器训练数据中的标签,无需人工提供标签。
  • 通过重新组合已学习的事件预测器,实现在推理时灵活的任务组合。
  • 将计算机视觉检测器作为事件线索的自动标签,实现端到端的自主技能获取。
  • 证明仅通过在推理时更改奖励函数,单一策略即可完成多种导航任务。

提出的方法

  • 利用机器人在真实或模拟环境中自主收集的离策略数据。
  • 使用视觉检测器(如车道、门检测)自动标注数据中的事件线索,避免人工标注奖励。
  • 训练动作条件预测模型(CAPs),根据当前观测和动作预测未来的事件状态。
  • 采用多头神经网络架构,从单一观测-动作对中同时预测多个事件线索。
  • 使用可微分损失函数,整合所有事件线索的预测误差,支持通过深度学习进行联合训练。
  • 在推理时,从预测的事件线索中组合生成特定任务的奖励函数,并通过规划或在线优化选择动作。

实验结果

研究问题

  • RQ1机器人能否在无任何人工作奖励提供的情况下,仅从离策略、自主收集的数据中学习预测多种事件线索?
  • RQ2已学习的事件预测器能否在推理时灵活重组,以实现多样化的导航任务而无需微调?
  • RQ3视觉检测器能否作为自动标签,实现控制策略的完全自主学习?
  • RQ4当仅在推理时更改奖励函数时,该框架在新任务上的泛化能力如何?
  • RQ5同一套 CAPs 模型能否利用相同的底层预测器,同时学习实现避碰和目标导向导航(如朝向门口)?

主要发现

  • CAPs 框架成功训练了一辆真实世界的 RC 小车,在 75 米环形路径上实现了 100% 的路径覆盖和 100% 的避碰率,仅在避碰任务上进行训练。
  • 当任务为接近门口时,同一套 CAPs 模型在完成环形路径任务中实现了 80% 的成功率,且比未使用门子奖励时多看到 17% 的门。
  • 该方法优于 GC-DQL,在组合多个目标时,GC-DQL 无法完成路径且在 100% 的试验中发生碰撞。
  • 通过仅在推理时更改奖励函数,同一套 CAPs 模型成功实现了多种任务(避碰、航向控制、门接近),证明了真正的可组合性。
  • 该模型能够高精度预测事件线索(如航向、速度、门的存在),从而有效支持复杂行为的规划。
  • 在涉及避碰、航向控制和门接近的多目标任务中,该方法实现了 98% 的路径覆盖率和 80% 的成功率,最佳配置下碰撞率为 0%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。