Skip to main content
QUICK REVIEW

[论文解读] Fleet-DAgger: Interactive Robot Fleet Learning with Scalable Human Supervision

Ryan Hoque, Lawrence Yunliang Chen|arXiv (Cornell University)|Jun 29, 2022
Domain Adaptation and Few-Shot Learning被引用 8
一句话总结

本文提出Fleet-DAgger,一种用于交互式机器人车队学习的新算法,通过在多台机器人之间智能分配人类监督者以最大化单位人力投入回报(ROHE)。利用基于GPU加速的Isaac Gym环境和4台ABB YuMi机械臂的真实实验,Fleet-DAgger在多机器人、多人力场景中通过基于不确定性和风险的智能请求优先级排序,使ROHE最高提升8.8倍,显著提升了学习效率。

ABSTRACT

Commercial and industrial deployments of robot fleets at Amazon, Nimble, Plus One, Waymo, and Zoox query remote human teleoperators when robots are at risk or unable to make task progress. With continual learning, interventions from the remote pool of humans can also be used to improve the robot fleet control policy over time. A central question is how to effectively allocate limited human attention. Prior work addresses this in the single-robot, single-human setting; we formalize the Interactive Fleet Learning (IFL) setting, in which multiple robots interactively query and learn from multiple human supervisors. We propose Return on Human Effort (ROHE) as a new metric and Fleet-DAgger, a family of IFL algorithms. We present an open-source IFL benchmark suite of GPU-accelerated Isaac Gym environments for standardized evaluation and development of IFL algorithms. We compare a novel Fleet-DAgger algorithm to 4 baselines with 100 robots in simulation. We also perform a physical block-pushing experiment with 4 ABB YuMi robot arms and 2 remote humans. Experiments suggest that the allocation of humans to robots significantly affects the performance of the fleet, and that the novel Fleet-DAgger algorithm can achieve up to 8.8x higher ROHE than baselines. See https://tinyurl.com/fleet-dagger for supplemental material.

研究动机与目标

  • 形式化定义交互式车队学习(IFL)场景,其中多台机器人在持续策略学习过程中与多名远程人类监督者进行交互。
  • 解决在大规模机器人车队中有限人力注意力分配的关键挑战,以最大化学习效率和系统吞吐量。
  • 提出一种新的评估指标——单位人力投入回报(ROHE),用于量化学习进展与人力工作量之间的权衡,体现车队学习中的效率。
  • 引入IFLB基准测试套件,包含GPU加速的Isaac Gym环境,用于IFL算法的标准化评估。
  • 通过大规模仿真(100台机器人)和真实世界物理实验(4台机器人,2名人类)验证所提出的Fleet-DAgger算法,结果表明其性能显著优于基线方法。

提出的方法

  • 提出一个正式的IFL框架,其中由N台机器人组成的车队通过来自M名远程监督者的交互式干预进行学习,采用机器人门控的分配策略ω实现人力的动态分配。
  • 引入单位人力投入回报(ROHE)作为新指标,量化单位人力投入下的学习进展,从而实现对不同分配策略的公平比较。
  • 设计Fleet-DAgger作为一类算法,利用不确定性、风险以及预测动作差异来优先处理机器人对人力监督的请求。
  • 使用Isaac Gym实现多智能体仿真环境,支持100台机器人并行训练和实时人机协同交互。
  • 在4台ABB YuMi机械臂和2名远程人类监督者上开展物理实验,通过远程操作和物理硬重置模拟真实世界车队动态。
  • 采用混合方法,结合离线模仿学习与在线交互式学习,利用人类干预随时间逐步优化共享机器人策略πθt。

实验结果

研究问题

  • RQ1如何在大规模机器人车队中有效分配人力监督,以最大化交互式车队学习中的学习效率并最小化人力工作量?
  • RQ2不同监督者分配策略对机器人车队学习性能和可扩展性的影响如何?
  • RQ3所提出的单位人力投入回报(ROHE)指标与传统指标相比,在评估多机器人场景下交互式学习算法有效性时有何优势?
  • RQ4可扩展的开源基准(IFLB)在多大程度上能够实现IFL算法的标准化评估与开发?
  • RQ5算法化监督者分配策略在面对具有不同响应行为的真实世界多模态人类监督者时,其泛化能力如何?

主要发现

  • 在100台机器人规模的大规模仿真中,Fleet-DAgger相较四种基线算法,单位人力投入回报(ROHE)最高提升8.8倍,显著提升了学习效率。
  • 在4台ABB YuMi机器人和2名人类监督者的物理实验中,Fleet-DAgger的C.U.R.变体在ROHE、累计成功次数、硬重置次数和空闲时间方面均优于基线方法。
  • 在真实世界实验中,C.U.R.与U.C.(Fleet-EnsembleDAgger)之间的性能差距小于仿真结果,表明高维图像观测使安全评论模型训练更具挑战性。
  • 人类监督者对等效有效动作的任意选择降低了基于不确定性的优先级策略的有效性,表明U优先策略在真实人类监督者中效果不如在确定性算法监督者中显著。
  • IFLB基准测试套件成功实现了基于GPU加速的Isaac Gym环境的可扩展、标准化的IFL算法评估,为未来车队学习研究提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。