Skip to main content
QUICK REVIEW

[论文解读] Model-based Behavioral Cloning with Future Image Similarity Learning

Alan H.B. Wu, AJ Piergiovanni|arXiv (Cornell University)|Oct 8, 2019
Reinforcement Learning in Robotics参考文献 37被引用 6
一句话总结

该论文提出了一种基于模型的行为克隆框架,仅从专家轨迹中学习一个随机的、以动作条件化的未来图像预测模型,通过选择使预测未来图像与专家结果最相似的动作,实现零样本策略学习。该方法通过利用视觉未来预测和相似性学习,无需任何真实世界试错数据,在真实世界机器人目标接近任务中实现了94%的成功率——是之前方法的2.5倍。

ABSTRACT

We present a visual imitation learning framework that enables learning of robot action policies solely based on expert samples without any robot trials. Robot exploration and on-policy trials in a real-world environment could often be expensive/dangerous. We present a new approach to address this problem by learning a future scene prediction model solely on a collection of expert trajectories consisting of unlabeled example videos and actions, and by enabling generalized action cloning using future image similarity. The robot learns to visually predict the consequences of taking an action, and obtains the policy by evaluating how similar the predicted future image is to an expert image. We develop a stochastic action-conditioned convolutional autoencoder, and present how we take advantage of future images for robot learning. We conduct experiments in simulated and real-life environments using a ground mobility robot with and without obstacles, and compare our models to multiple baseline methods.

研究动机与目标

  • 在无需任何策略内试错的情况下,实现从有限专家演示中进行真实世界机器人策略学习。
  • 通过利用学习到的未来预测模型泛化到未见状态,解决行为克隆中的协变量偏移问题。
  • 通过将视觉未来图像相似性作为动作选择的评论家,提升模仿学习性能。
  • 开发一个随机的、以动作条件化的卷积自编码器,使其能泛化到非专家动作和未见状态。
  • 在无需目标标注或奖励信号的情况下,实现在真实世界和仿真环境中的高性能表现。

提出的方法

  • 训练一个随机的动作条件化卷积自编码器,仅使用专家轨迹从当前观测和动作预测未来图像。
  • 该模型使用循环神经网络(LSTM)估计随机先验,提升在随机环境中的鲁棒性。
  • 联合训练一个未来图像相似性网络,以评估预测未来图像与专家提供的未来图像之间的相似度。
  • 通过选择使预测未来图像与专家未来图像相似度最高的动作来推导动作策略,作为学习到的评论家。
  • 该框架在零试错设置下运行,仅依赖专家视频和动作对,无需额外的真实世界交互。
  • 通过利用学习到的状态转移模型的泛化能力,使方法能够泛化到未见状态和动作。

实验结果

研究问题

  • RQ1仅在专家轨迹上训练的未来图像预测模型,能否泛化到非专家动作和未见状态?
  • RQ2在零试错模仿学习中,引入未来图像相似性如何提升行为克隆性能?
  • RQ3在真实世界环境中,预测模型中的随机先验是否能提升视觉未来预测质量?
  • RQ4在真实世界和仿真环境中,该方法相较于标准行为克隆和基线模仿学习方法,性能提升程度如何?
  • RQ5在真实世界环境中,该方法对干扰物和未标记目标的鲁棒性如何?

主要发现

  • 所提方法在真实世界机器人目标接近任务中实现了94%的成功率,较次佳基线方法提升2.5倍。
  • 在仿真障碍物避让任务中,该方法使用随机模型实现了63%的成功率,显著优于确定性模型和行为克隆基线。
  • 随机状态模型实现了5.98的DTW相似度得分,为所有方法中最低,表明其轨迹与专家演示高度相似。
  • 该方法成功忽略干扰物,在无目标标注的情况下导航至目标,于存在干扰物的情况下实现了4.94的DTW得分。
  • 未来图像相似性模型实现了有效的零样本策略学习,能良好泛化到未见状态和动作,且无需专家查询。
  • 在自编码器中使用随机先验提升了图像生成质量,并促进了更好的策略泛化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。