Skip to main content
QUICK REVIEW

[论文解读] What Would You Do? Acting by Learning to Predict

Adam W. Tow, Niko Sünderhauf|arXiv (Cornell University)|Mar 8, 2017
Reinforcement Learning in Robotics参考文献 24被引用 4
一句话总结

本文提出了一种名为学习预测(Learning from Prediction, LfP)的新颖机器人任务学习方法,通过从单张图像预测视觉状态转移,实现对人类示范的模仿。通过训练PredNet模型从视觉观测中预测下一状态,机器人能够在仅执行极少机器人动作的情况下泛化至未见过的状态,并成功完成任务:在使用序列预测时,movetopos任务的成功率达到100%;在使用单张图像预测时,也取得了较高的成功率。

ABSTRACT

We propose to learn tasks directly from visual demonstrations by learning to predict the outcome of human and robot actions on an environment. We enable a robot to physically perform a human demonstrated task without knowledge of the thought processes or actions of the human, only their visually observable state transitions. We evaluate our approach on two table-top, object manipulation tasks and demonstrate generalisation to previously unseen states. Our approach reduces the priors required to implement a robot task learning system compared with the existing approaches of Learning from Demonstration, Reinforcement Learning and Inverse Reinforcement Learning.

研究动机与目标

  • 使机器人能够直接从人类视觉示范中学习任务,而无需依赖运动学映射、奖励信号或动作-状态标注。
  • 通过消除对机器人特定运动学、奖励函数或示范者动作序列的依赖,减少机器人学习中的先验假设。
  • 仅使用示范期间观察到的视觉状态转移,实现对未见过的环境状态的泛化。
  • 通过无需特定机器人的示范(如YouTube视频)实现从人类到机器人的任务迁移。
  • 通过在选择最优动作前预测所有动作的结果,最小化机器人上的动作执行次数。

提出的方法

  • 使用确定性示范序列,训练PredNet架构从单张图像预测下一视觉状态,以支持单张图像推理。
  • 利用人类示范中观察到的状态转移序列,训练模型以泛化至未见过的状态。
  • 通过在机器人执行的轨迹上微调同一模型,使机器人能够预测自身动作的结果。
  • 在每个状态下,通过将预测的下一状态与人类示范者的预测下一状态进行比较,评估所有可能动作的性能。
  • 选择使预测结果与人类示范者预测下一状态之间视觉差异最小的机器人动作。
  • 通过引入先前状态的历史信息,提升预测性能,尤其在单张图像预测不可靠的情况下。

实验结果

研究问题

  • RQ1机器人能否仅通过视觉状态转移实现对人类任务的模仿,而无需访问示范者动作或运动学信息?
  • RQ2单张图像状态预测模型在任务执行期间对未见过的环境状态的泛化能力如何?
  • RQ3与单张图像预测相比,使用序列历史信息在预测准确性和任务成功率方面有何提升?
  • RQ4同一预测模型能否同时用于人类示范预测和机器人动作结果预测?
  • RQ5预测误差对任务执行有何影响?失败是否可追溯至早期阶段的预测不准确?

主要发现

  • 当使用基于序列的状态预测时,LfP方法在movetopos任务上实现了100%的成功率,覆盖了所有可能的物体起始位置。
  • 在使用单张图像预测时,若首次状态预测正确,94.0%的轨迹成功;而所有失败的轨迹均源于首次状态预测错误。
  • 所有失败的轨迹均起源于首次状态的错误预测,表明早期预测错误是失败的主要原因。
  • 仅有3.6%的成功轨迹以错误的首次状态预测开始,且没有任何成功轨迹在首次状态预测正确后发生失败。
  • 一个示例表明,即使单张图像预测质量差的状态,若通过先前状态序列逐步接近,仍可被正确预测,体现了上下文信息的优势。
  • 在pushpull任务中,模型实现了71.4%的单张图像预测正确率,其中96.4%的成功轨迹均从首次状态预测正确开始。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。