Skip to main content
QUICK REVIEW

[论文解读] Skill Learning by Autonomous Robotic Playing using Active Learning and Creativity

Simon Hangl, Vedran Dunjko|arXiv (Cornell University)|Jun 26, 2017
Robot Manipulation and Learning参考文献 56被引用 15
一句话总结

本文提出了一种混合强化学习框架,使机器人能够通过主动探索和创造性思维,自主扩展预训练操作技能的适用范围。通过在自主玩耍过程中学习环境模型,机器人利用主动学习优先选择信息量丰富的状态,并创造性地组合出新颖的预备行为,显著提升了学习效率,实现了对以往无法解决的任务(如积木塔拆解)的求解。

ABSTRACT

We treat the problem of autonomous acquisition of manipulation skills where problem-solving strategies are initially available only for a narrow range of situations. We propose to extend the range of solvable situations by autonomous playing with the object. By applying previously-trained skills and behaviours, the robot learns how to prepare situations for which a successful strategy is already known. The information gathered during autonomous play is additionally used to learn an environment model. This model is exploited for active learning and the creative generation of novel preparatory behaviours. We apply our approach on a wide range of different manipulation tasks, e.g. book grasping, grasping of objects of different sizes by selecting different grasping strategies, placement on shelves, and tower disassembly. We show that the creative behaviour generation mechanism enables the robot to solve previously-unsolvable tasks, e.g. tower disassembly. We use success statistics gained during real-world experiments to simulate the convergence behaviour of our system. Experiments show that active improves the learning speed by around 9 percent in the book grasping scenario.

研究动机与目标

  • 解决将预训练操作技能的适用范围扩展到更广泛环境状态的挑战。
  • 使机器人能够通过自主驱动的玩耍,自主探索并为已知基础行为准备新情境。
  • 通过使用学习到的环境模型来引导主动学习与创造性行为生成,提升学习效率。
  • 通过生成复合预备行为,使机器人能够解决以往难以处理的任务,例如积木塔拆解。
  • 弥合简单行为串联与发育机器人学中早期目标导向规划之间的差距。

提出的方法

  • 机器人采用无模型强化学习设置,每次轨迹包含感知、预备行为以及基础行为的执行。
  • 在玩耍过程中,机器人将环境的前向模型作为副产品进行学习,从而实现在无需真实轨迹的情况下进行仿真与规划。
  • 主动学习通过利用环境模型识别并过渡到更具信息量或探索不足的感知状态来实现。
  • 通过利用环境模型预测可行性与成功率,将已知行为组合成新颖序列,实现创造性行为生成。
  • 系统采用分层技能表示,包含感知动作、预备行为与基础行为,支持模块化与可扩展的学习。
  • 利用真实世界实验的成功统计数据,模拟在预备行为数量不断增加时的收敛行为。

实验结果

研究问题

  • RQ1机器人能否通过自主驱动的探索,自主扩展预训练基础行为的适用情境范围?
  • RQ2在机器人操作中,引入学习到的环境模型在多大程度上能提升无模型强化学习的学习效率?
  • RQ3与随机探索相比,主动学习在多大程度上能减少技能获取所需的轨迹数量?
  • RQ4通过已知行为的组合实现的创造性行为生成,能否使机器人解决在现有技能集下原本无法解决的任务?
  • RQ5随着可用预备行为数量的增加,技能学习的收敛速度如何变化?主动学习能否缓解这一扩展性问题?

主要发现

  • 在书籍抓取场景中,模拟真实世界成功统计数据表明,主动学习使所需轨迹数量减少了约9%。
  • 在书籍抓取任务中,成功率最初呈现缓慢上升阶段(30–35%),这是由于环境模型尚未训练成熟且缺少高角度旋转行为,随后在模型成熟后出现急剧上升。
  • 创造性行为生成使机器人能够通过生成新颖的复合预备行为,解决以往被认为无法解决的任务,如积木塔拆解。
  • 带有创造力的收敛行为呈现出明显模式:初期缓慢,随后快速提升,最终渐进收敛至100%,表明对复杂行为序列的有效探索。
  • 学习速度被发现与预备行为数量成正比,凸显了可扩展性挑战,而主动学习虽能缓解但无法完全解决该问题。
  • 环境模型使有效仿真与规划成为可能,使机器人能够优先选择信息量丰富的状态,并避免在已知情境中重复进行轨迹尝试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。