Skip to main content
QUICK REVIEW

[论文解读] Model-Based Visual Planning with Self-Supervised Functional Distances

Stephen Tian, Suraj Nair|arXiv (Cornell University)|Dec 30, 2020
Artificial Intelligence in Games参考文献 58被引用 17
一句话总结

本文提出MBOLD,一种基于模型的视觉规划自监督方法,通过从离线、未标注数据中学习动态距离函数和视觉动态模型,实现对视觉目标的高效规划。通过结合短时程规划与基于Q函数的距离度量,该方法在目标到达任务中表现优异,在模拟和真实世界操作任务(包括物体推动和抽屉开启)中均优于模型无关与基于模型的基线方法。

ABSTRACT

A generalist robot must be able to complete a variety of tasks in its environment. One appealing way to specify each task is in terms of a goal observation. However, learning goal-reaching policies with reinforcement learning remains a challenging problem, particularly when hand-engineered reward functions are not available. Learned dynamics models are a promising approach for learning about the environment without rewards or task-directed data, but planning to reach goals with such a model requires a notion of functional similarity between observations and goal states. We present a self-supervised method for model-based visual goal reaching, which uses both a visual dynamics model as well as a dynamical distance function learned using model-free reinforcement learning. Our approach learns entirely using offline, unlabeled data, making it practical to scale to large and diverse datasets. In our experiments, we find that our method can successfully learn models that perform a variety of tasks at test-time, moving objects amid distractors with a simulated robotic arm and even learning to open and close a drawer using a real-world robot. In comparisons, we find that this approach substantially outperforms both model-free and model-based prior methods. Videos and visualizations are available here: http://sites.google.com/berkeley.edu/mbold.

研究动机与目标

  • 在无需奖励标签的情况下,实现从大规模、多样化、未标注数据集中的通用机器人学习。
  • 解决仅在离线、任务无关数据可用时,向视觉目标进行规划的挑战。
  • 学习一种反映功能相似性而非仅视觉外观的动态距离函数。
  • 结合预测性视觉动态模型与学习到的距离函数,实现有效的长时程规划。
  • 仅使用离线数据,将视觉目标到达能力扩展至真实世界机器人系统。

提出的方法

  • 从离线、未标注的图像序列中学习视觉动态模型,以预测未来状态。
  • 通过类似Q-learning的贝尔曼更新进行近似动态规划,从相同离线数据中学习动态距离函数。
  • 该距离函数估计最优策略从任一状态到达目标所需的步数,同时考虑环境动态特性。
  • 通过将动态模型用于短时程滚动预测,结合学习到的距离函数作为全局代价函数,实现视觉模型预测控制。
  • 在训练过程中采用负样本过渡挖掘,以提升复杂场景中(如存在干扰物)的距离泛化能力。
  • 端到端训练距离函数,完全不依赖任何奖励信号或人工监督。

实验结果

研究问题

  • RQ1机器人能否仅使用离线、未标注数据,学会到达任意视觉目标?
  • RQ2在无奖励信号或任务特定监督的情况下,如何度量状态之间的功能相似性?
  • RQ3将视觉动态模型与学习到的动态距离函数结合,是否能提升视觉控制任务中的长时程规划性能?
  • RQ4与基于像素的L2距离或VAE潜在空间距离等启发式度量相比,自监督距离学习表现如何?
  • RQ5该方法能否在无需在线微调的情况下泛化至真实世界机器人操作任务?

主要发现

  • 在1个物体推动任务中,MBOLD的成功率为55.2% ± 4.3%,显著优于模型无关Q函数基线的19.2% ± 3.6%。
  • 在3个物体推动任务中,MBOLD的成功率为44.8% ± 2.9%,而模型无关基线为15.6% ± 3.6%。
  • 在目标到达任务中,MBOLD的成功率为94.4% ± 3.3%,远超模型无关基线的31.8% ± 5.2%。
  • 基于Q函数的距离度量在所有物体推动任务中均优于VAE潜在空间距离和直接的时间距离回归。
  • 负样本过渡挖掘显著提升了性能,尤其在更复杂的任务中,有效减少了对机器人手臂等视觉显著特征的过度依赖。
  • 该方法成功迁移至真实世界抽屉操作任务,在相同基准上优于Visual Foresight。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。