Skip to main content
QUICK REVIEW

[论文解读] Human-Robot Collaboration via Deep Reinforcement Learning of Real-World Interactions

Jonas Tjomsland, Ali Shafti|arXiv (Cornell University)|Dec 2, 2019
Reinforcement Learning in Robotics被引用 6
一句话总结

本论文提出了一种基于软演员-critic(SAC)深度强化学习的人机协作系统,使机器人仅通过30分钟的真实世界交互即可学会一项非平凡的物理协作任务,与人类-人类团队的性能相当,且无需仿真预训练或显式的人类模型个性化。

ABSTRACT

We present a robotic setup for real-world testing and evaluation of human-robot and human-human collaborative learning. Leveraging the sample-efficiency of the Soft Actor-Critic algorithm, we have implemented a robotic platform able to learn a non-trivial collaborative task with a human partner, without pre-training in simulation, and using only 30 minutes of real-world interactions. This enables us to study Human-Robot and Human-Human collaborative learning through real-world interactions. We present preliminary results, showing that state-of-the-art deep learning methods can take human-robot collaborative learning a step closer to that of humans interacting with each other.

研究动机与目标

  • 开发一种真实世界机器人平台,用于研究人机协作与人-人协作学习,且不依赖仿真预训练。
  • 探究样本高效的深度强化学习是否能够使机器人直接从真实的人机交互中学习协作任务。
  • 评估DRL智能体是否能在物理世界中以最少的真实世界交互完成非平凡协作任务并达到人类水平的协作性能。
  • 探索仅使用真实世界数据从零开始进行人机协同训练的可行性,避免模拟到现实的领域偏移问题。

提出的方法

  • 系统采用带有自动温度调节的软演员-critic(SAC)算法,实现样本高效的深度强化学习。
  • 使用配备托盘的Universal Robots UR10机器人,由DRL智能体控制,学习沿一个轴旋转托盘以引导小球到达目标位置。
  • 人类伙伴通过带有动作捕捉标记的遥操作界面控制另一个托盘轴,实现实时交互。
  • 人类动作通过带有200毫秒延迟的PD控制器映射为机器人指令,模拟真实的人机交互动力学。
  • DRL智能体观测小球与托盘位置的联合状态,并基于连续动作空间采取行动,以优化任务成功率。
  • 训练完全在真实世界中进行,无需仿真,仅使用30分钟的人机交互和少于4,000次交互步骤。

实验结果

研究问题

  • RQ1DRL智能体是否仅通过30分钟的真实世界交互即可与人类伙伴学会一项非平凡的协作任务?
  • RQ2通过真实世界DRL训练的人机团队在相同任务中的表现是否与人类-人类团队相当?
  • RQ3当人类伙伴在训练过程中调整策略时(未显式建模人类行为),智能体的表现如何演变?
  • RQ4样本高效的深度强化学习是否能够实现从零开始的人机协同训练,避免仿真预训练的需要?

主要发现

  • 人机团队在30分钟真实世界训练内解决了协作任务,DRL智能体在测试试验中平均得分为185.6分(满分200分)。
  • 在人类-人类对比实验中,十名受试者中有五名在与智能体协作和与人类专家协作时表现无显著差异。
  • 在前500步内至少两次成功到达目标的受试者表现出更优的长期协作性能,表明早期成功至关重要。
  • DRL智能体对人类行为适应表现出鲁棒性,即使未显式建模人类伙伴,其性能仍随时间提升。
  • 该系统在无需仿真预训练的情况下实现了人类水平的协作性能,凸显了真实世界、人机协同DRL的可行性。
  • 学习曲线显示不一致性随时间下降,表明随着训练推进,人类与智能体之间的协调性逐步提高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。